El proyecto llama.cpp ha añadido soporte para el núcleo Flash Attention (FA) a la configuración específica utilizada por MiniCPM3 en Apple Silicon. Este cambio soluciona un fallo donde la bandera `-fa auto` se abortaba debido a una instanciación de núcleo faltante para la longitud de clave de atención 96 y longitud de valor 64.
- Se añadieron núcleos de mosaico en (96, 64) para cada tipo K/V que ya soporta (96, 96).
- Se añadieron núcleos vec para configuraciones NE=4, ya que este es el único valor donde NL divide tanto DK/4 como DV/4.
- Se actualizaron las pruebas para evitar cobertura redundante de cortes vec FA.
Esta actualización permite que los modelos MiniCPM3 se ejecuten con Flash Attention habilitado en dispositivos macOS e iOS sin encontrar errores de núcleo.