Проект llama.cpp добавил поддержку ядра Flash Attention (FA) для конкретной конфигурации, используемой в MiniCPM3 на Apple Silicon. Это изменение устраняет сбой, при котором флаг `-fa auto` завершался ошибкой из-за отсутствия инициализации ядра для длины ключа внимания 96 и длины значения 64.
- Добавлены тайловые ядра размером (96, 64) для каждого типа K/V, который уже поддерживает (96, 96).
- Добавлены векторные ядра для конфигураций NE=4, так как это единственное значение, при котором NL делится на DK/4 и DV/4.
- Обновлены тесты для устранения избыточного покрытия срезов векторов FA.
Это обновление позволяет моделям MiniCPM3 работать с включенным Flash Attention на устройствах macOS и iOS без ошибок ядра.