La version b10171 de llama.cpp corrige un bug critique dans les noyaux d'image Adreno KQ/KQV qui provoquait des sorties corrompues lors de lots de séquences multiples. Le problème est survenu car ces noyaux ignoraient la dimension 3, entraînant des lectures incorrectes lors de l'utilisation du cache KV unifié avec plusieurs flux.

  • Achemine les tenseurs avec ne03/ne13 > 1 vers le chemin général qui gère correctement la dim 3.
  • Respecte view_offs lors de la création de sous-buffers pour éviter les lectures erronées silencieuses.
  • Corrige les scores de perplexité sur les appareils Adreno 740 et 840, réduisant la PPL d'environ 1940 à environ 15,6 pour Llama-3.2-1B-Instruct Q4_0.
  • Inclut des binaires pour macOS, iOS, Linux, Android, Windows et openEuler sur les backends CPU, GPU et spécialisés.

Cette correction garantit des résultats d'inférence corrects sur les appareils Adreno où Flash Attention est désactivé ou indisponible, empêchant la dégradation des performances dans les configurations serveur à multiples slots.