El proyecto llama.cpp lanzó la versión b11160, introduciendo una implementación de matriz cooperativa int8 (coopmat1) para Vulkan en las arquitecturas AMD RDNA3 y RDNA4. Esta actualización incluye un shader dedicado que sondea los valores coopmat directamente para mejorar el rendimiento.

  • Añade soporte de cuantización IQ4_XS al shader de matmul entero mul_mmq_cm1.
  • Implementa la aplicación de escala en línea, sumas escalares y doble buffering para el backend de Vulkan.
  • Soporta las cuantizaciones q8_0, q4_1, q5_0, q5_1, iq4_nl, mxfp4, q3_k, q4_k, q5_k, q6_k y nvfp4.
  • Incluye binarios para macOS, Linux, Windows, Android y openEuler a través de los backends CPU, CUDA, ROCm, OpenVINO y SYCL.