ソース · llama.cpp
github llama.cpp · 9時間前 · 1 回表示

llama.cpp b11282 が MUSA デバイスパスに対して CUDA_ARCH を定義

llama.cpp プロジェクトはビルド b11282 をリリースし、MUSA デバイスパスに対して `CUDA_ARCH` マクロを定義する修正を含んでいます。以前は、MUSA ベンダーヘッダーがこの変数を定義しておらず、共有の ggml-cuda ソース内のアーキテクチャテストがゼロに評価され、空のカーネルボディになる原因となっていました。

github llama.cpp · 19時間前 · 2 回表示

llama.cpp b11266はIntelのVulkan向けにF32 A行列を一度に2つ読み込む

llama.cppプロジェクトは、Vulkanの最適化を含むビルドb11266をリリースしました。この最適化では、2アラインメントされたF32 A行列を一度に2要素ずつ読み込みます。この変更は、浮動小数点数を一つずつ読み込むのが非効率なIntelハードウェアでのパフォーマンス問題を解決し、元のパッチで`a_offset`の整列に関する検証が欠落していた点も修正します。

github llama.cpp · 1日前 · 1 回表示

llama.cpp b11258 は UI が提供されていない場合、組み込み UI service worker を削除

llama.cpp プロジェクトはビルド b11258 をリリースし、これは組み込み Web インターフェースの service worker の動作に関する修正を含んでいます。以前は、`--path` や `--no-ui` などのフラグを使用すると、サーバーが `/sw.js` に対して 404 を返すため、ブラウザがインターフェースのキャッシュされたバージョンを保持し続けました。これは service worker の削除を引き起こしません。

github llama.cpp · 1日前 · 7 回表示

llama.cpp b11254がパイプライン並列化におけるグラフ入力収集を修正

llama.cppプロジェクトは、計算グラフ内での入力テンソルの収集方法を修正したビルドb11254をリリースしました。従来、`graph_inputs`はグラフ分割中に設定されていたため、異なる入力を消費するバッチ間で切り替えると、誤ったバックエンドIDの比較が発生し、スケジューラの再予約が強制されるという問題が生じていました。

github llama.cpp · 2日前 · 3 回表示

llama.cpp b11240が/v1/embeddingsに型付きマルチモーダル入力サポートを追加

llama.cppサーバーは、/v1/embeddingsエンドポイントに対して型付きコンテンツ(ビジョン、オーディオ、ビデオ)の入力をサポートするようになりました。この更新により、OpenAIスタイルのラップされたコンテンツ配列を受け入れることで、マルチモーダル埋め込みリクエストが可能になり、textとimage_urlの部分を一緒に処理できます。

github llama.cpp · 2日前 · 4 回表示

llama.cpp b11238 が ggml_pad_ext を追加し、左パディングに対応して DFlash2 タップをスキップ

llama.cpp プロジェクトはビルド b11238 をリリースし、新しい `ggml_pad_ext` 関数を通じて統一された左パディング実装を導入しました。この変更により、Parakeet、LFM2-Audio、Granite Speech、Gemma 4 などの音声エンコーダーで以前使用されていた方法が統合され、Gemma 4 の埋め込みがビット単位で同一になることが保証されるとともに、バックエンドのサポートが簡素化されました。

github llama.cpp · 2日前 · 3 回表示

llama.cpp b11228 が Metal GGML_OP_PAD に左側および円形パディングのサポートを追加

llama.cpp b11228 リリースは、Metal バックエンドの GGML_OP_PAD 操作において左側および円形パディングのサポートを導入し、CPU、CUDA、Vulkan の実装と整合させました。この変更により、置換されたソースの右側パディングの問題が修正され、異なるハードウェアバックエンド間で一貫した動作が保証されます。

github llama.cpp · 3日前 · 13 回表示

llama.cpp b11216が512を超えるブロック幅に対するSYCL FWHTカーネルを追加

llama.cpp b11216リリースでは、512より大きいブロック幅をサポートするSYCLバックエンドにFast Walsh-Hadamard Transform (FWHT) カーネルが導入されました。以前は、より大きな幅はO(n^2)の複雑さを持つ密なGEMMにフォールバックしていましたが、この変更によりこれらのサイズでO(n log n)のパフォーマンスが可能になります。

github llama.cpp · 3日前 · 14 回表示

llama.cpp b11214 が CDNA で大きなバッチサイズ向けに fattn-mma カーネルを有効化

llama.cpp プロジェクトはバージョン b11214 をリリースしました。これには HIP バックエンドへの重要な更新が含まれています。このリリースでは、dkq > 256 の場合、CDNA アーキテクチャ上で fattn-mma カーネルが有効化され、大きなバッチサイズ向けの性能向上を特に狙っています。