Релиз llama.cpp b10171 устраняет критическую ошибку в ядрах изображений Adreno KQ/KQV, которая вызывала появление мусора при обработке пакетов с несколькими последовательностями. Проблема возникла из-за того, что эти ядра игнорировали размерность 3, что приводило к некорректному чтению данных при использовании единого KV-кэша с несколькими потоками.
- Маршрутизирует тензоры с ne03/ne13 > 1 по общему пути, который корректно обрабатывает размерность 3.
- Учитывает view_offs при создании подбуферов для предотвращения скрытых ошибок чтения.
- Исправляет оценки перплексии на устройствах Adreno 740 и 840, снижая PPL с ~1940 до ~15.6 для модели Llama-3.2-1B-Instruct Q4_0.
- Включает бинарные файлы для macOS, iOS, Linux, Android, Windows и openEuler для CPU, GPU и специализированных бэкендов.
Это исправление обеспечивает корректные результаты инференса на устройствах Adreno, где Flash Attention отключен или недоступен, предотвращая снижение производительности в конфигурациях серверов с несколькими слотами.