O projeto llama.cpp adicionou suporte ao kernel Flash Attention (FA) para a configuração específica usada pelo MiniCPM3 no Apple Silicon. Esta alteração corrige uma falha onde a flag `-fa auto` abortava devido à falta de instanciação de kernel para o comprimento da chave de atenção 96 e do valor 64.
- Adicionados kernels tile em (96, 64) para cada tipo K/V que já suporta (96, 96).
- Adicionados kernels vec para configurações NE=4, pois este é o único valor onde NL divide tanto DK/4 quanto DV/4.
- Testes atualizados para evitar cobertura redundante de fatias vec FA.
Esta atualização permite que os modelos MiniCPM3 sejam executados com Flash Attention habilitado em dispositivos macOS e iOS sem encontrar erros de kernel.