llama.cpp プロジェクトはビルド b11370 をリリースしました。これには、ベクトル量子化 (MMVQ) を備えた MoE 混合アーキテクチャに共有エキスパートを融合するための CUDA オプティマイゼーションが含まれています。この変更はプルリクエスト #29184 の一部であり、stride_col_dst のバッファ null チェックと引数処理も処理しています。
- CUDA バックエンド向けに MMVQ に共有エキスパートを融合します。
- 安定性を向上させるためにバッファの null チェックを追加します。
- stride_col_dst を融合引数に移動します。
このリリースでは、CPU、Vulkan、ROCm、OpenVINO、SYCL、Snapdragon などのさまざまなハードウェア アクセラレータに対応する、macOS、Linux、Windows、Android、iOS 用の更新されたバイナリが提供されます。