llama.cpp b10751がCUDA向けMoE加重エクスパート集約を融合
llama.cppプロジェクトはビルドb10751をリリースし、CUDAにおけるMoE(Mixture of Experts)の加重エクスパート集約用の融合カーネルを導入しました。この最適化は、2つの物理カーネルを実行していた以前のベースラインを置き換え、中間のグローバルメモリトラフィックを削減するために単一の加重集約カーネルを使用します。
llama.cppプロジェクトはビルドb10751をリリースし、CUDAにおけるMoE(Mixture of Experts)の加重エクスパート集約用の融合カーネルを導入しました。この最適化は、2つの物理カーネルを実行していた以前のベースラインを置き換え、中間のグローバルメモリトラフィックを削減するために単一の加重集約カーネルを使用します。
llama.cppプロジェクトはビルドb10750をリリースし、シーケンス位置のインデックス付けとn-gram履歴のルックアップを改善するためにキーバリューセルの管理をリファクタリングしました。
llama.cpp プロジェクトはバージョン b10742 をリリースしました。これには、MacBook Neo に搭載されている Apple A18 Pro チップ用に特別に高速ベクトル (fa-vec) 調整を追加する新機能が含まれています。
llama.cpp プロジェクトはバージョン b10739 をリリースしました。これには Apple の M2 Max ハードウェア向けの特定の性能最適化が含まれています。このアップデートでは、M2 Max の 30 個の GPU コアに合わせた高速注意ベクトル (fa-vec) 調整が導入されました。
Hugging Faceは、Hugging Face Hubから最適化されたWebGPUカーネルを読み込んで実行するためのライブラリである@huggingface/kernelsと、207個のカーネルの初期コレクションをリリースしました。また、ユーザーのデバイスからパフォーマンスと正確性の証拠を集約するブラウザ内GPUベンチマークスイート「Fleet」も導入されました。
llama.cpp プロジェクトはバージョン b10734 をリリースしました。これには、M5+ または A19+ チップを搭載したデバイス向けに Metal 4.0 tensor API を有効にする更新が含まれています。
TurboderpはExLlamaV3に重要なアップデートを提供し、Mixture of Experts (MoE) 専門家のためのCPUオフロード機能を導入しました。このアップデートには、新たにリリースされたGLM-5.3-FlashおよびQwen3.8-Flashモデルのサポートも含まれます。
llama.cpp プロジェクトはビルド b10724 をリリースし、連続する実行ごとのバッチ処理された scatter リードによって非連続な KV キャッシュセルの復元パフォーマンスを大幅に改善しました。
llama.cpp プロジェクトはビルド b10721 をリリースしました。これには WebGPU バックエンドの重要な修正と、Windows 上のハードウェアサポートの拡張が含まれています。
llama.cpp プロジェクトはバージョン b10718 をリリースし、CUDA バックエンドの重要なアップデートが含まれています。最も注目すべき変更は、Mixture of Experts (MOE) 融合をスペキュレイティブデコーディング(specdec)のサポートに拡張し、以前 MOE glu 融合と topk-router 融合が一度に1つのトークンの処理のみ制限されていたという制限に対処したことです。
llama.cpp プロジェクトはビルド b10715 をリリースしました。これには DFlash 実装に対する重要な最適化が含まれています。DFlash エンコーダは、デコーディング中に KV キャッシュ注入プロセスに直接融合されるようになりました。
llama.cpp プロジェクトは、AMD Strix Halo ハードウェアを対象とした Vulkan バックエンドの特定の最適化を含むビルド b10714 をリリースしました。このアップデートは、バッチ推論中のパフォーマンスを向上させるために行列-ベクトル乗算の行数を調整します。
llama.cpp プロジェクトは、ggml バックエンドに新しい機能をもたらすビルド b10706 をリリースしました。このアップデートには、SWIGLU_CLAMP の追加と新しい Vulkan シェーダーの実装が含まれています。
llama.cpp プロジェクトは、キーバリュー (KV) キャッシュ処理のパフォーマンス最適化を含むバージョン b10707 をリリースしました。このアップデートでは、`for_each_token_in` 関数が修正され、特定セル内のすべてのシーケンスが確認された時点でスキャンを停止するようになり、可能な最大シーケンスすべてを反復処理するのではなく動作します。
llama.cpp プロジェクトはビルド b10688 をリリースしました。これには、M2 アーキテクチャ用の高速ベクトル (fa-vec) 調整を追加するプルリクエストが含まれています。
llama.cppプロジェクトは、2世代のAdreno GPUにおける行列乗算のパフォーマンスを向上させるため、OpenCLバックエンドを更新しました。この変更は主にX2E世代を対象としており、xmem F16xF32 GEMMパスをデフォルトで有効にし、A7X世代の処理を最適化しています。
llama.cpp プロジェクトはバージョン b10684 をリリースし、`--fit` フラグが `--fit-target` をより正確に尊重するようにする SYCL バックエンド用の特定の不具合修正が含まれています。
llama.cpp プロジェクトはバージョン b10670 をリリースし、Intel の Xe2 アーキテクチャ用の特定の最適化が含まれています。この更新では、量子化されたキーバリュー (KV) デコード操作を BMG ハードウェアに対して TILE バックエンドのみにルーティングし、他のアーキテクチャについては検証されるまで VEC バックエンドを維持します。
llama.cpp プロジェクトはバージョン b10669 をリリースし、oneDNN SDPA パスのパフォーマンス最適化として、f16 KV キャッシュをその場でバインドする機能を含めています。
llama.cpp b10666 リリースは、test-save-load-state スイートをすべてのアーキテクチャで実行するように拡張し、状態管理およびグラフ処理におけるいくつかの重大なバグを解決しました。主な変更点には、minimax-01 におけるダングリング参照の修正、デバイス上シーケンスのチャンクコピーの整合性確保、および deepseek4 のインデクサヘッド数の補正が含まれます。