Le projet llama.cpp a ajouté la prise en charge du noyau Flash Attention (FA) pour la configuration spécifique utilisée par MiniCPM3 sur Apple Silicon. Cette modification corrige un plantage où le drapeau `-fa auto` s'arrêtait en raison d'une instanciation de noyau manquante pour la longueur de clé d'attention 96 et la longueur de valeur 64.

  • Ajout de noyaux tuilés à (96, 64) pour chaque type K/V qui prend déjà en charge (96, 96).
  • Ajout de noyaux vec pour les configurations NE=4, car c'est la seule valeur où NL divise à la fois DK/4 et DV/4.
  • Tests mis à jour pour éviter une couverture redondante des tranches vec FA.

Cette mise à jour permet aux modèles MiniCPM3 de s'exécuter avec Flash Attention activé sur les appareils macOS et iOS sans rencontrer d'erreurs de noyau.