llama.cpp 프로젝트는 버전 b11160을 출시하여 AMD RDNA3 및 RDNA4 아키텍처의 Vulkan에서 int8 협력 행렬(coopmat1) 구현을 도입했습니다. 이 업데이트에는 성능을 개선하기 위해 coopmat 값을 직접 probing하는 전용 셰이더가 포함되어 있습니다.

  • mul_mmq_cm1 정수 행렬 곱 셰이더에 IQ4_XS 양자화 지원을 추가했습니다.
  • Vulkan 백엔드를 위한 인라인 스케일 적용, 스칼라 합산 및 더블 버퍼링을 구현했습니다.
  • q8_0, q4_1, q5_0, q5_1, iq4_nl, mxfp4, q3_k, q4_k, q5_k, q6_k 및 nvfp4 양자화를 지원합니다.
  • CPU, CUDA, ROCm, OpenVINO 및 SYCL 백엔드에 대해 macOS, Linux, Windows, Android 및 openEuler용 바이너리를 포함합니다.