llama.cpp プロジェクトはバージョン b11160 をリリースし、AMD RDNA3 および RDNA4 アーキテクチャの Vulkan 向けに int8 協調行列 (coopmat1) の実装を導入しました。このアップデートには、パフォーマンスを向上させるために coopmat の値を直接プローブする専用シェーダーが含まれています。

  • mul_mmq_cm1 整数 matmul シェーダーに IQ4_XS 量子化サポートを追加。
  • Vulkan バックエンド向けにインラインスケーリング適用、スカラ合計、およびダブルバッファリングを実装。
  • q8_0, q4_1, q5_0, q5_1, iq4_nl, mxfp4, q3_k, q4_k, q5_k, q6_k、および nvfp4 量子化をサポート。
  • CPU、CUDA、ROCm、OpenVINO、および SYCL バックエンド across macOS、Linux、Windows、Android、および openEuler のバイナリを含みます。