llama.cpp プロジェクトはバージョン b10900 をリリースしました。これには Vulkan バックエンドへの技術的更新が含まれています。このリリースでは、プリフィルフェーズ中に topk_moe 融合最適化を有効にするために、割り当て依存関係が追加されました。

  • 主要なコード変更は、プリフィル操作の topk_moe 融合をサポートするために Vulkan 実装に割り当て依存関係を追加することです。
  • macOS (Apple Silicon および Intel)、Linux (CPU、Vulkan、ROCm 10.0、OpenVINO、SYCL)、Windows (CPU、CUDA 12/13、Vulkan、OpenVINO、SYCL、ROCm 10.0)、Android、および iOS のバイナリが提供されています。
  • このビルドでは、macOS Apple Silicon 用の KleidiAI サポートが無効になっています。

このアップデートにより、新しく有効になった融合技術を通じて、Vulkan 互換ハードウェア上で最適化されたプリフィルパフォーマンスがユーザーに提供されます。