Проект llama.cpp выпустил сборку b11232, включающую обновления бэкенда ggml-cpu. Релиз сосредоточен на включении tiled flash attention для измерений голов без кратности вектору на архитектурах x86.

  • Включено tiled flash attention для измерений голов без кратности вектору на x86.
  • Добавлена поддержка AVX2 для маскированной загрузки и сохранения в simd_gemm_ukernel_tail.
  • Исправлена обработка softcap FA для заполненных KV тайлов.

Это обновление предоставляет бинарные файлы для macOS, Linux, Windows, Android и openEuler для бэкендов CPU, GPU и NPU.