O projeto llama.cpp lançou a versão b11160, introduzindo uma implementação de matriz cooperativa int8 (coopmat1) para Vulkan nas arquiteturas AMD RDNA3 e RDNA4. Esta atualização inclui um shader dedicado que sonda os valores coopmat diretamente para melhorar o desempenho.
- Adiciona suporte à quantização IQ4_XS ao shader de matmul inteiro mul_mmq_cm1.
- Implementa aplicação de escala inline, somas escalares e double buffering para o backend Vulkan.
- Suporta as quantizações q8_0, q4_1, q5_0, q5_1, iq4_nl, mxfp4, q3_k, q4_k, q5_k, q6_k e nvfp4.
- Inclui binários para macOS, Linux, Windows, Android e openEuler através dos backends CPU, CUDA, ROCm, OpenVINO e SYCL.