llama.cpp b11284 が量子化された重みビューの OpenVINO GET_ROWS を修正
llama.cpp プロジェクトはビルド b11284 をリリースしました。これには、量子化された重みビューに対する GET_ROWS 操作を正しく処理するための OpenVINO バックエンドの修正が含まれています。
llama.cpp プロジェクトはビルド b11284 をリリースしました。これには、量子化された重みビューに対する GET_ROWS 操作を正しく処理するための OpenVINO バックエンドの修正が含まれています。
llama.cpp プロジェクトはバージョン b11280 をリリースしました。これには、ピンドッドホストバッファを使用してテンソルアールレデュース同期を削減する変更が含まれています。
llama.cpp プロジェクトはビルド b11282 をリリースし、MUSA デバイスパスに対して `CUDA_ARCH` マクロを定義する修正を含んでいます。以前は、MUSA ベンダーヘッダーがこの変数を定義しておらず、共有の ggml-cuda ソース内のアーキテクチャテストがゼロに評価され、空のカーネルボディになる原因となっていました。
llama.cppプロジェクトは、GLM-5.3-Flash (GLM5-Next) モデルアーキテクチャの初期サポートを追加しました。これには、ハイブリッドインデックスメモリへの移行と早期のMulti-Token Prediction (MTP) 機能が含まれます。
llama.cpp プロジェクトはビルド b11273 をリリースし、リランキングモデルにおける `classifier_pooling` メソッドのサポートを導入しました。これは特に ModernBERT アーキテクチャを対象としています。
llama.cpp プロジェクトは、Hexagon バックエンドの最適化を含むビルド b11272 をリリースしました。主な変更点は、Qualcomm Snapdragon ハードウェアでのパフォーマンス向上のために連結演算を最適化することです。
llama.cppプロジェクトは、Vulkanの最適化を含むビルドb11266をリリースしました。この最適化では、2アラインメントされたF32 A行列を一度に2要素ずつ読み込みます。この変更は、浮動小数点数を一つずつ読み込むのが非効率なIntelハードウェアでのパフォーマンス問題を解決し、元のパッチで`a_offset`の整列に関する検証が欠落していた点も修正します。
llama.cpp b11265 リリースには、Vulkan バックエンドによる Mixture of Experts (MoE) モデルの処理に関する修正が含まれています。この更新では、`mat_mul_id` が行列乗算タイルを選択する方法が修正され、ディスパッチ中にワーカーがアイドル状態になるパフォーマンスの問題が解消されました。
llama.cpp プロジェクトは、Hexagon バックエンドで FP32 GELU_ERF と GEGLU_ERF 活性化関数のサポートを導入するバージョン b11260 をリリースしました。このアップデートには、関連するカーネル内のレジスタ圧力を軽減する最適化も含まれています。
llama.cpp プロジェクトはビルド b11258 をリリースし、これは組み込み Web インターフェースの service worker の動作に関する修正を含んでいます。以前は、`--path` や `--no-ui` などのフラグを使用すると、サーバーが `/sw.js` に対して 404 を返すため、ブラウザがインターフェースのキャッシュされたバージョンを保持し続けました。これは service worker の削除を引き起こしません。
llama.cppプロジェクトは、計算グラフ内での入力テンソルの収集方法を修正したビルドb11254をリリースしました。従来、`graph_inputs`はグラフ分割中に設定されていたため、異なる入力を消費するバッチ間で切り替えると、誤ったバックエンドIDの比較が発生し、スケジューラの再予約が強制されるという問題が生じていました。
llama.cppサーバーは、/v1/embeddingsエンドポイントに対して型付きコンテンツ(ビジョン、オーディオ、ビデオ)の入力をサポートするようになりました。この更新により、OpenAIスタイルのラップされたコンテンツ配列を受け入れることで、マルチモーダル埋め込みリクエストが可能になり、textとimage_urlの部分を一緒に処理できます。
llama.cpp プロジェクトはビルド b11238 をリリースし、新しい `ggml_pad_ext` 関数を通じて統一された左パディング実装を導入しました。この変更により、Parakeet、LFM2-Audio、Granite Speech、Gemma 4 などの音声エンコーダーで以前使用されていた方法が統合され、Gemma 4 の埋め込みがビット単位で同一になることが保証されるとともに、バックエンドのサポートが簡素化されました。
llama.cpp プロジェクトはビルド b11232 をリリースし、ggml-cpu バックエンドの更新が含まれています。今回のリリースは、x86 アーキテクチャ上でベクトル倍数ではないヘッド次元に対してタイルドフラッシュアテンションを有効化することに焦点を当てています。
llama.cpp b11228 リリースは、Metal バックエンドの GGML_OP_PAD 操作において左側および円形パディングのサポートを導入し、CPU、CUDA、Vulkan の実装と整合させました。この変更により、置換されたソースの右側パディングの問題が修正され、異なるハードウェアバックエンド間で一貫した動作が保証されます。
llama.cpp プロジェクトはビルド b11227 をリリースし、マルチモーダル処理中の `causal_attn` フラグの処理を対象としたパフォーマンス最適化を含んでいます。
llama.cpp b11224 リリースは、KV キャッシュなどのより大きくストライド付きのテンソルのスライスを読み取る際に、Vulkan バックエンドで行列乗算演算が誤った計算結果を生じる問題を解決します。
llama.cpp サーバーは、Qwen3 や Qwen3-VL などの因果 LLM リランカーに対して RANK pooling batch splitting を許可するようになり、長いドキュメントやマルチモーダルなリランキングを壊していた以前の制限が解消されました。
llama.cpp b11216リリースでは、512より大きいブロック幅をサポートするSYCLバックエンドにFast Walsh-Hadamard Transform (FWHT) カーネルが導入されました。以前は、より大きな幅はO(n^2)の複雑さを持つ密なGEMMにフォールバックしていましたが、この変更によりこれらのサイズでO(n log n)のパフォーマンスが可能になります。
llama.cpp プロジェクトはバージョン b11214 をリリースしました。これには HIP バックエンドへの重要な更新が含まれています。このリリースでは、dkq > 256 の場合、CDNA アーキテクチャ上で fattn-mma カーネルが有効化され、大きなバッチサイズ向けの性能向上を特に狙っています。