llama.cpp 0.3.0 は、新しい DSA-ISWA KV キャッシュタイプとともに dots3-note マルチモーダルモデルのサポートを導入し、GLM-4.5-Air に対するマルチトークン予測(MTP)サポートも追加しました。今回のリリースでは DeepSeek 4 の tensor-split 機能の追加と、マルチシーケンスのロールバック問題の修正も行われています。

  • ggml が v0.22.0 にアップグレードされ、meta-backend および並列コンパイル対応の per-op Metal カーネルに tensor-split サポートが追加されました。
  • mtmd は dots3-note の視覚/音声サポート、ffmpeg による WebP デコーディング、および Pillow と同等の正確なリサイズアルゴリズムを獲得しました。
  • DeepSeek 4 は `-sm tensor` フラグによる tensor-split モードと、複数シーケンスでのロールバックに関する修正を受けました。
  • サーバーには `LLAMA_SERVER_SLOTS_N_DIFF` デバッグノブが追加され、Web UI にはタブ付きチャットナビゲーションが実装されました。

このアップデートは llama.cpp のマルチモーダル機能を拡張し、DeepSeek 4 や GLM-4.5-Air といった特定のモデルアーキテクチャのパフォーマンスと安定性を向上させます。