トピック · Local inference
github llama.cpp · 3時間前 · 1 回表示

llama.cpp b10751がCUDA向けMoE加重エクスパート集約を融合

llama.cppプロジェクトはビルドb10751をリリースし、CUDAにおけるMoE(Mixture of Experts)の加重エクスパート集約用の融合カーネルを導入しました。この最適化は、2つの物理カーネルを実行していた以前のベースラインを置き換え、中間のグローバルメモリトラフィックを削減するために単一の加重集約カーネルを使用します。

lab Hugging Face Blog · 8時間前 · 3 回表示

Hugging Faceが207のWebGPUカーネルとブラウザベンチマークツールをリリース

Hugging Faceは、Hugging Face Hubから最適化されたWebGPUカーネルを読み込んで実行するためのライブラリである@huggingface/kernelsと、207個のカーネルの初期コレクションをリリースしました。また、ユーザーのデバイスからパフォーマンスと正確性の証拠を集約するブラウザ内GPUベンチマークスイート「Fleet」も導入されました。

github llama.cpp · 1日前 · 9 回表示

llama.cpp b10718 が specdec およびマルチトークン向けに MOE 融合を拡張

llama.cpp プロジェクトはバージョン b10718 をリリースし、CUDA バックエンドの重要なアップデートが含まれています。最も注目すべき変更は、Mixture of Experts (MOE) 融合をスペキュレイティブデコーディング(specdec)のサポートに拡張し、以前 MOE glu 融合と topk-router 融合が一度に1つのトークンの処理のみ制限されていたという制限に対処したことです。

github llama.cpp · 2日前 · 11 回表示

llama.cpp b10707 がより高速な生成のために KV キャッシュセルのスキャンを最適化

llama.cpp プロジェクトは、キーバリュー (KV) キャッシュ処理のパフォーマンス最適化を含むバージョン b10707 をリリースしました。このアップデートでは、`for_each_token_in` 関数が修正され、特定セル内のすべてのシーケンスが確認された時点でスキャンを停止するようになり、可能な最大シーケンスすべてを反復処理するのではなく動作します。

github llama.cpp · 4日前 · 10 回表示

llama.cpp b10670 が Xe2 (BMG) 上の TILE に量子化 KV デコードをルーティング

llama.cpp プロジェクトはバージョン b10670 をリリースし、Intel の Xe2 アーキテクチャ用の特定の最適化が含まれています。この更新では、量子化されたキーバリュー (KV) デコード操作を BMG ハードウェアに対して TILE バックエンドのみにルーティングし、他のアーキテクチャについては検証されるまで VEC バックエンドを維持します。

github llama.cpp · 5日前 · 7 回表示

llama.cpp b10666 が状態の保存・読み込みテストとデバイス上シーケンスコピーを修正

llama.cpp b10666 リリースは、test-save-load-state スイートをすべてのアーキテクチャで実行するように拡張し、状態管理およびグラフ処理におけるいくつかの重大なバグを解決しました。主な変更点には、minimax-01 におけるダングリング参照の修正、デバイス上シーケンスのチャンクコピーの整合性確保、および deepseek4 のインデクサヘッド数の補正が含まれます。