Проект llama.cpp выпустил сборку b11232, включающую обновления бэкенда ggml-cpu. Релиз сосредоточен на включении tiled flash attention для измерений голов без кратности вектору на архитектурах x86.
- Включено tiled flash attention для измерений голов без кратности вектору на x86.
- Добавлена поддержка AVX2 для маскированной загрузки и сохранения в simd_gemm_ukernel_tail.
- Исправлена обработка softcap FA для заполненных KV тайлов.
Это обновление предоставляет бинарные файлы для macOS, Linux, Windows, Android и openEuler для бэкендов CPU, GPU и NPU.