O projeto llama.cpp lançou a compilação b10754, que inclui uma correção crítica para o OpenCL em GPUs Adreno para prevenir leituras de memória fora dos limites em kernels de processamento de imagens.

  • A busca da linha de decodificação q4_K GEMV agora é limitada em uma grade x preenchida.
  • O contrato de agrupamento para GEMMs KQ/KQV de imagem é estritamente aplicado.
  • A lógica de divisão para a imagem KQ/KQV é determinada no momento do despacho, em vez de depender dos passos (strides).

Esta atualização garante estabilidade e correção para usuários que executam o llama.cpp com aceleração OpenCL em hardware Adreno.