Проект llama.cpp выпустил версию b11160, внедряя реализацию int8 cooperative matrix (coopmat1) для Vulkan на архитектурах AMD RDNA3 и RDNA4. Это обновление включает выделенный шейдер, который напрямую опрашивает значения coopmat для повышения производительности.
- Добавлена поддержка квантования IQ4_XS в шейдер целочисленного matmul mul_mmq_cm1.
- Реализовано применение масштаба на месте, скалярные суммы и двойная буферизация для бэкенда Vulkan.
- Поддерживаются квантования q8_0, q4_1, q5_0, q5_1, iq4_nl, mxfp4, q3_k, q4_k, q5_k, q6_k и nvfp4.
- Включены бинарные файлы для macOS, Linux, Windows, Android и openEuler для бэкендов CPU, CUDA, ROCm, OpenVINO и SYCL.