Le projet llama.cpp a publié la version b10615, introduisant des opérations vectorielles flash-attention quantifiées (Q, NE) ajustées par appareil pour le backend Metal.
- Ajout de 53 instanciations de vecteurs flash-attn f16, portant le total de 80 à 133.
- Mise en œuvre d'une table de réglage et d'un câblage de dispatch avec fallback de capacité de mémoire partagée.
- Extension du réglage des vecteurs pour prendre en charge les caches KV quantifiés.
- Inclusion de paramètres ajustés pour les appareils M1 Pro, M2 Ultra et M5 Max.
Cette mise à jour optimise les performances sur le matériel Apple Silicon en appliquant des résultats de réglage spécifiques au backend Metal.