Проект llama.cpp добавил поддержку ядра Flash Attention (FA) для конкретной конфигурации, используемой в MiniCPM3 на Apple Silicon. Это изменение устраняет сбой, при котором флаг `-fa auto` завершался ошибкой из-за отсутствия инициализации ядра для длины ключа внимания 96 и длины значения 64.

  • Добавлены тайловые ядра размером (96, 64) для каждого типа K/V, который уже поддерживает (96, 96).
  • Добавлены векторные ядра для конфигураций NE=4, так как это единственное значение, при котором NL делится на DK/4 и DV/4.
  • Обновлены тесты для устранения избыточного покрытия срезов векторов FA.

Это обновление позволяет моделям MiniCPM3 работать с включенным Flash Attention на устройствах macOS и iOS без ошибок ядра.