Проект llama.cpp выпустил сборку b10165, которая восстанавливает поддержку квантования iq4_nl для бэкенда Flash Attention (FA) на Vulkan. Это изменение решает проблему #23681, повторно включая функцию после того, как опасения по поводу использования общей памяти были признаны незначительными.

  • Возвращает поддержку iq4_nl в реализацию Vulkan FA.
  • Добавляет поддержку q1_0 для конфигураций non-coopmat2.
  • Исправляет проблему GitHub #23681, касающуюся удаления поддержки q1_0 FA.

Релиз предоставляет бинарные файлы для macOS, Linux, Windows и Android для бэкендов CPU, CUDA, ROCm, OpenVINO, SYCL и Vulkan.