llama.cpp プロジェクトはビルド b11064 をリリースし、dsv4_hc_pre カーネルで任意のヘッド数 (hc) をサポートするように metal バックエンドを変更しました。以前は、これらのカーネルで hc = 4 がハードコードされており、他のヘッド数を持つ操作が CPU 実行にフォールバックしていました。

  • この変更では n_hc を関数定数として渡し、直接ロードを使用して両方の pre カーネルでループします。
  • hc の値 1、2、3、5、8、65 に対する test-backend-ops ケースが追加され、ゲートありとゲートなしの両方のシナリオをカバーしました。
  • この更新により、Kimi-K3 などのモデルがクロスレイヤー残差スタック内の動的なバンクチェックポイントカウントをサポートすることで、GPU で効率的に実行できるようになります。

リリースには、CPU、CUDA、ROCm、Vulkan、OpenVINO、SYCL を含むさまざまなハードウェアバックエンド向けの macOS、Linux、Windows、Android、openEuler 用のバイナリが含まれています。