llama.cpp b10171 版本解决了 Adreno KQ/KQV 图像内核中的一个关键错误,该错误在批量处理多序列时导致输出乱码。此问题源于这些内核忽略了维度 3,在使用统一 KV 缓存和多流时导致读取错误。
- 将 ne03/ne13 > 1 的张量路由到能正确处理维度 3 的通用路径。
- 在创建子缓冲区时尊重 view_offs,以防止静默读取错误。
- 修复 Adreno 740 和 840 设备上的困惑度分数,使 Llama-3.2-1B-Instruct Q4_0 的 PPL 从约 1940 降至约 15.6。
- 提供适用于 macOS、iOS、Linux、Android、Windows 和 openEuler 的二进制文件,覆盖 CPU、GPU 及专用后端。
此修复确保了在禁用或不可用 Flash Attention 的 Adreno 设备上获得正确的推理结果,防止多槽位服务器配置中的性能下降。