llama.cpp b10236 リリースでは、DSv4 Lightning Indexer の Metal 実装が導入され、F32 クエリと重み、および F16 キーとマスクを伴う 128 次元入力を特にサポートしています。
- アップデートには、KV 長が 8 および 64 要素の境界付近にある場合の処理のためのタイル化および末尾カーネルが含まれます。
- K タイルは simdgroup 行列ロードの前に F16 スレッドグループメモリにステージされ、F32、F16、BF16、および各種量子化フォーマットをサポートします。
ベンチマークでは、以前のバージョンと比較して、10k、20k、30k トークンのシーケンス長でプリフィルスループット (pp512) が向上していることが示されています。
この最適化は、Lightning Indexer のメモリアクセスパターンを改善することで、Apple Silicon デバイスでの推論パフォーマンスを向上させます。