llama.cppプロジェクトはバージョン0.4.1をリリースし、CPU上でMaple 20B-A1Bの3値MoEアーキテクチャのサポート、およびTencent Hy 4とSpark2.5モデルのプレビューサポートを導入しました。
- Maple 20B-A1Bの3値MoEアーキテクチャ(CPU)サポートを追加。
- Tencent Hy 4 (hy_v4) プレビューアーキテクチャサポートを追加。
- Spark2.5モデルサポートを追加。
- ggmlをv0.24.0に更新し、新しい精度制御APIによりバックエンドの対応範囲と堅牢性を拡張。
- common_schema内部表現によるリファクタリングでJSONスキーマ処理を改善。
- 専門的なチャットパーサーをcommon/parsersに分割し、--log-jsonl経由で構造化されたJSONLログを追加。
- DeepSeek2、GLM-MoE、および関連モデルのMTPコンテキストKVキャッシュ割り当てを修正。
- 対象となるQwen/Kimi/GLMモデルのGDN正規化をmaxからrsqrtへ修正。
このリリースにより、新しいモデルアーキテクチャの実行が可能になり、正規化、キャッシュ割り当て、サーバー子プロセス管理の修正を通じて安定性が向上しました。