El proyecto llama.cpp lanzó la compilación b10813, que introduce una implementación de OpenCL para GPUs Adreno utilizando la ruta xmem SDPA (Scaled Dot-Product Attention). Esta actualización también aborda errores numéricos en los mecanismos GQA y atención enmascarada.
- Añadida la ruta Adreno xmem SDPA para aceleración OpenCL.
- Eliminada la anulación de perfilado de colas específica de Adreno.
- Corregidos errores numéricos en GQA y atención enmascarada.
- Introducida la variable de entorno GGML_OPENCL_XMEM_SDPA para controlar la función.
El lanzamiento proporciona binarios para macOS, Linux, Windows, Android y openEuler a través de backends de CPU, GPU y hardware especializado.