llama.cppプロジェクトはバージョンb10538をリリースし、metalバックエンドに重要な最適化を導入しました。このアップデートにより、キー・バリュー(KV)キャッシュのデ量子化が大きなバッチサイズに対してのみ有効になります。

  • 主な変更点はmetalバックエンドにあり、大きなバッチを処理している場合のみデ量子化されたKVキャッシングを適用します。
  • macOS (Apple SiliconおよびIntel)、iOS、Linux (CPU、Vulkan、OpenVINO、SYCL)、Android、Windows (CPU、CUDA 12/13、Vulkan、OpenVINO、SYCL、ROCm)、openEuler用のバイナリが利用可能です。
  • このリリースでは、macOS Apple SiliconでのKleidiAIサポートとUbuntuでのROCm 7.14が無効になっています。

この最適化は、互換性のあるハードウェア上で大きなバッチサイズを含むワークロードのメモリ効率またはパフォーマンスを向上させることを目的としています。