llama.cpp プロジェクトはバージョン b10900 をリリースしました。これには Vulkan バックエンドへの技術的更新が含まれています。このリリースでは、プリフィルフェーズ中に topk_moe 融合最適化を有効にするために、割り当て依存関係が追加されました。
- 主要なコード変更は、プリフィル操作の topk_moe 融合をサポートするために Vulkan 実装に割り当て依存関係を追加することです。
- macOS (Apple Silicon および Intel)、Linux (CPU、Vulkan、ROCm 10.0、OpenVINO、SYCL)、Windows (CPU、CUDA 12/13、Vulkan、OpenVINO、SYCL、ROCm 10.0)、Android、および iOS のバイナリが提供されています。
- このビルドでは、macOS Apple Silicon 用の KleidiAI サポートが無効になっています。
このアップデートにより、新しく有効になった融合技術を通じて、Vulkan 互換ハードウェア上で最適化されたプリフィルパフォーマンスがユーザーに提供されます。