O projeto llama.cpp lançou a compilação b10754, que inclui uma correção crítica para o OpenCL em GPUs Adreno para prevenir leituras de memória fora dos limites em kernels de processamento de imagens.
- A busca da linha de decodificação q4_K GEMV agora é limitada em uma grade x preenchida.
- O contrato de agrupamento para GEMMs KQ/KQV de imagem é estritamente aplicado.
- A lógica de divisão para a imagem KQ/KQV é determinada no momento do despacho, em vez de depender dos passos (strides).
Esta atualização garante estabilidade e correção para usuários que executam o llama.cpp com aceleração OpenCL em hardware Adreno.