O projeto llama.cpp lançou a versão b11160, introduzindo uma implementação de matriz cooperativa int8 (coopmat1) para Vulkan nas arquiteturas AMD RDNA3 e RDNA4. Esta atualização inclui um shader dedicado que sonda os valores coopmat diretamente para melhorar o desempenho.

  • Adiciona suporte à quantização IQ4_XS ao shader de matmul inteiro mul_mmq_cm1.
  • Implementa aplicação de escala inline, somas escalares e double buffering para o backend Vulkan.
  • Suporta as quantizações q8_0, q4_1, q5_0, q5_1, iq4_nl, mxfp4, q3_k, q4_k, q5_k, q6_k e nvfp4.
  • Inclui binários para macOS, Linux, Windows, Android e openEuler através dos backends CPU, CUDA, ROCm, OpenVINO e SYCL.