O lançamento llama.cpp b10171 corrige um bug crítico nos kernels de imagem Adreno KQ/KQV que causava saída de lixo durante lotes de múltiplas sequências. O problema surgiu porque esses kernels ignoravam a dimensão 3, levando a leituras incorretas ao usar o cache KV unificado com vários streams.

  • Encaminha tensores com ne03/ne13 > 1 para o caminho geral que lida corretamente com a dim 3.
  • Respeita view_offs ao criar sub-buffers para evitar leituras erradas silenciosas.
  • Corrige as pontuações de perplexidade nos dispositivos Adreno 740 e 840, reduzindo a PPL de ~1940 para ~15.6 no Llama-3.2-1B-Instruct Q4_0.
  • Inclui binários para macOS, iOS, Linux, Android, Windows e openEuler em CPUs, GPUs e backends especializados.

Esta correção garante resultados de inferência corretos em dispositivos Adreno onde o Flash Attention está desabilitado ou indisponível, impedindo a degradação do desempenho em configurações de servidor multi-slot.