Проект llama.cpp выпустил сборку b10781, которая содержит исправление для пути деквантования быстрого внимания (FA) Vulkan. Обновление устраняет проблему, при которой шейдер неверно проверял `nb[3]`, даже когда `ne[3] == 1`, из-за чего путь включался только при полном кэше.

  • Пропускает проверку `nb[3]`, когда `ne[3] == 1`, поскольку шейдер никогда не читает её для одного потока.
  • Устраняет логическую ошибку, при которой представления кэша содержали шаг полного буфера, сводя старую проверку к `n_kv == kv_size`.
  • Предоставляет бинарные файлы для macOS (Apple Silicon и Intel), iOS, Linux (CPU, Vulkan, ROCm, OpenVINO, SYCL), Android, Windows (CPU, CUDA 12/13, Vulkan, OpenVINO, SYCL, ROCm) и openEuler.

Это исправление гарантирует корректное включение пути деквантования Vulkan FA во время вывода, а не только при состояниях полного кэша.