El proyecto llama.cpp lanzó la compilación b10069, que incluye actualizaciones específicas de OpenCL para GPUs Qualcomm Adreno. El cambio principal implica soportar operaciones de difusión para el kernel Adreno MUL_MAT y respetar los desplazamientos de vista para la variante Q8_0 MUL_MAT para habilitar la funcionalidad multi-stream en llama-server.
- Añadido soporte de difusión para kernels GEMM/GEMV noshuffle de Adreno.
- Asegurado que los desplazamientos de vista se manejan correctamente para operaciones GEMM/GEMV noshuffle de Adreno.
- Implementado soporte general de difusión GEMM/GEMV dentro del backend OpenCL.
- Eliminadas pruebas y comentarios innecesarios de la base de código.
Esta actualización mejora la compatibilidad con cargas de trabajo multi-stream en hardware Adreno al corregir problemas críticos de manejo de kernels.