Proyek llama.cpp merilis versi b11160, memperkenalkan implementasi matriks kooperatif int8 (coopmat1) untuk Vulkan pada arsitektur AMD RDNA3 dan RDNA4. Pembaruan ini mencakup shader khusus yang probing nilai coopmat secara langsung untuk meningkatkan kinerja.

  • Menambahkan dukungan kuantisasi IQ4_XS ke shader matmul integer mul_mmq_cm1.
  • Mengimplementasikan penerapan skala inline, jumlah skalar, dan double buffering untuk backend Vulkan.
  • Mendukung kuantisasi q8_0, q4_1, q5_0, q5_1, iq4_nl, mxfp4, q3_k, q4_k, q5_k, q6_k, dan nvfp4.
  • Termasuk biner untuk macOS, Linux, Windows, Android, dan openEuler di seluruh backend CPU, CUDA, ROCm, OpenVINO, dan SYCL.