La versión b10171 de llama.cpp aborda un error crítico en los núcleos de imagen KQ/KQV de Adreno que causaba salida basura durante lotes de múltiples secuencias. El problema surgió porque estos núcleos ignoraban la dimensión 3, lo que provocaba lecturas incorrectas al utilizar el caché KV unificado con múltiples flujos.
- Enruta los tensores con ne03/ne13 > 1 al camino general que maneja correctamente la dim 3.
- Respeta view_offs al crear sub-buffers para prevenir lecturas erróneas silenciosas.
- Corrige las puntuaciones de perplexity en dispositivos Adreno 740 y 840, reduciendo PPL de ~1940 a ~15.6 para Llama-3.2-1B-Instruct Q4_0.
- Incluye binarios para macOS, iOS, Linux, Android, Windows y openEuler en CPU, GPU y backends especializados.
Esta corrección garantiza resultados de inferencia correctos en dispositivos Adreno donde Flash Attention está deshabilitado o no disponible, previniendo la degradación del rendimiento en configuraciones de servidor multi-slot.