Проект llama.cpp выпустил сборку b10165, которая восстанавливает поддержку квантования iq4_nl для бэкенда Flash Attention (FA) на Vulkan. Это изменение решает проблему #23681, повторно включая функцию после того, как опасения по поводу использования общей памяти были признаны незначительными.
- Возвращает поддержку iq4_nl в реализацию Vulkan FA.
- Добавляет поддержку q1_0 для конфигураций non-coopmat2.
- Исправляет проблему GitHub #23681, касающуюся удаления поддержки q1_0 FA.
Релиз предоставляет бинарные файлы для macOS, Linux, Windows и Android для бэкендов CPU, CUDA, ROCm, OpenVINO, SYCL и Vulkan.