El proyecto llama.cpp lanzó la compilación b10069, que incluye actualizaciones específicas de OpenCL para GPUs Qualcomm Adreno. El cambio principal implica soportar operaciones de difusión para el kernel Adreno MUL_MAT y respetar los desplazamientos de vista para la variante Q8_0 MUL_MAT para habilitar la funcionalidad multi-stream en llama-server.

  • Añadido soporte de difusión para kernels GEMM/GEMV noshuffle de Adreno.
  • Asegurado que los desplazamientos de vista se manejan correctamente para operaciones GEMM/GEMV noshuffle de Adreno.
  • Implementado soporte general de difusión GEMM/GEMV dentro del backend OpenCL.
  • Eliminadas pruebas y comentarios innecesarios de la base de código.

Esta actualización mejora la compatibilidad con cargas de trabajo multi-stream en hardware Adreno al corregir problemas críticos de manejo de kernels.