llama.cpp プロジェクトはビルド b11064 をリリースし、dsv4_hc_pre カーネルで任意のヘッド数 (hc) をサポートするように metal バックエンドを変更しました。以前は、これらのカーネルで hc = 4 がハードコードされており、他のヘッド数を持つ操作が CPU 実行にフォールバックしていました。
- この変更では n_hc を関数定数として渡し、直接ロードを使用して両方の pre カーネルでループします。
- hc の値 1、2、3、5、8、65 に対する test-backend-ops ケースが追加され、ゲートありとゲートなしの両方のシナリオをカバーしました。
- この更新により、Kimi-K3 などのモデルがクロスレイヤー残差スタック内の動的なバンクチェックポイントカウントをサポートすることで、GPU で効率的に実行できるようになります。
リリースには、CPU、CUDA、ROCm、Vulkan、OpenVINO、SYCL を含むさまざまなハードウェアバックエンド向けの macOS、Linux、Windows、Android、openEuler 用のバイナリが含まれています。