llama.cpp v0.6.0 は、トークンと埋め込み入力の混合に対応する新しい llama_batch_ext 拡張バッチ API、GLM-5.3-Flash 320B ハイブリッドモデル、および Clef 判断モデルのサポートを導入します。
- 新しい llama_batch_ext API は、MTP および deepstack モデルのトークンごとの状態埋め込みをサポートします。
- Qwen4Exp は MTP 推測デコーディングにより高品質なサポートを提供し、DGX Spark で約 1.5 倍のデコード速度向上を実現します。
- 新しい /v1/systemone サーバー API は、laya、julia-1、lev、openjev、kev の 5 つの判断モデルをサポートします。
- Metal は F16 KV および MMA 行列乗算カーネルに対して Apple GPU で最大 3 倍高速な tensor-API flash attention カーネルを取得しました。
- Web UI は Hugging Face Hub データレイヤーとモデルダウンロードパイプラインを含む大規模な改修を受けました。
このリリースは、llama.cpp のマルチモーダル処理、推測デコーディングパフォーマンス、および判断モデル統合の機能を拡張します。