El proyecto llama.cpp ha añadido soporte para el núcleo Flash Attention (FA) a la configuración específica utilizada por MiniCPM3 en Apple Silicon. Este cambio soluciona un fallo donde la bandera `-fa auto` se abortaba debido a una instanciación de núcleo faltante para la longitud de clave de atención 96 y longitud de valor 64.

  • Se añadieron núcleos de mosaico en (96, 64) para cada tipo K/V que ya soporta (96, 96).
  • Se añadieron núcleos vec para configuraciones NE=4, ya que este es el único valor donde NL divide tanto DK/4 como DV/4.
  • Se actualizaron las pruebas para evitar cobertura redundante de cortes vec FA.

Esta actualización permite que los modelos MiniCPM3 se ejecuten con Flash Attention habilitado en dispositivos macOS e iOS sin encontrar errores de núcleo.