llama.cpp b11265 リリースには、Vulkan バックエンドによる Mixture of Experts (MoE) モデルの処理に関する修正が含まれています。この更新では、`mat_mul_id` が行列乗算タイルを選択する方法が修正され、ディスパッチ中にワーカーがアイドル状態になるパフォーマンスの問題が解消されました。
- 以前は、タイル選択はトークン総数に依存しており、MoE ディスパッチグリッドでは実際の N はワーキンググループあたりのエキスパートごとの行数であるため、これは誤りでした。
- Sarvam 30B のようなモデルで pp128 を使用する場合、このエラーによりピッカーは 128 ではなく約 6 つのライブ行に対してタイルを選択していました。
- この修正により、グループ内のすべてのワーカーに作業が行き渡り、以前はジョブの期間の 55% を占めていた無駄な時間が解消されました。
この変更により、GPU ワーカー間で適切なワークロード分散が確保され、Vulkan 上の MoE モデルの推論効率が向上します。