El proyecto llama.cpp lanzó la compilación b10754, que incluye una corrección crítica para OpenCL en GPUs Adreno para prevenir lecturas de memoria fuera de los límites en núcleos de procesamiento de imágenes.
- La búsqueda de fila de decodificación q4_K GEMV ahora está acotada en una cuadrícula x rellena.
- El contrato de agrupamiento para GEMMs KQ/KQV de imagen se aplica estrictamente.
- La lógica de división para la imagen KQ/KQV se determina en el momento del envío, en lugar de depender de los pasos (strides).
Esta actualización garantiza estabilidad y corrección para usuarios que ejecutan llama.cpp con aceleración OpenCL en hardware Adreno.