llama.cppプロジェクトはバージョン0.4.1をリリースし、CPU上でMaple 20B-A1Bの3値MoEアーキテクチャのサポート、およびTencent Hy 4とSpark2.5モデルのプレビューサポートを導入しました。

  • Maple 20B-A1Bの3値MoEアーキテクチャ(CPU)サポートを追加。
  • Tencent Hy 4 (hy_v4) プレビューアーキテクチャサポートを追加。
  • Spark2.5モデルサポートを追加。
  • ggmlをv0.24.0に更新し、新しい精度制御APIによりバックエンドの対応範囲と堅牢性を拡張。
  • common_schema内部表現によるリファクタリングでJSONスキーマ処理を改善。
  • 専門的なチャットパーサーをcommon/parsersに分割し、--log-jsonl経由で構造化されたJSONLログを追加。
  • DeepSeek2、GLM-MoE、および関連モデルのMTPコンテキストKVキャッシュ割り当てを修正。
  • 対象となるQwen/Kimi/GLMモデルのGDN正規化をmaxからrsqrtへ修正。

このリリースにより、新しいモデルアーキテクチャの実行が可能になり、正規化、キャッシュ割り当て、サーバー子プロセス管理の修正を通じて安定性が向上しました。