llama.cppプロジェクトはバージョンb11035をリリースし、VulkanバックエンドでIQ3_S MMQ行列乗算カーネルのサポートを導入しました。

  • 更新にはVulkan用の新しいIQ3_S MMQ matmulカーネルが含まれます。
  • Block_a_to_shmemはメモリアクセスを最適化するために2バイトロードを実行するようになりました。
  • IQ3_SがKタイルサイズを使用するため、アライメントチェックが調整されました。
  • バイナリはCPU、CUDA、ROCm、OpenVINO、SYCL、OpenCLプラットフォーム上でmacOS、Linux、Windows、Android、openEulerで利用可能です。

このリリースにより、さまざまなオペレーティングシステムとハードウェアアクセラレーター用の更新されたバイナリが提供され、ユーザーは新しいVulkan量子化サポートを活用できます。