El proyecto llama.cpp lanzó la compilación b10813, que introduce una implementación de OpenCL para GPUs Adreno utilizando la ruta xmem SDPA (Scaled Dot-Product Attention). Esta actualización también aborda errores numéricos en los mecanismos GQA y atención enmascarada.

  • Añadida la ruta Adreno xmem SDPA para aceleración OpenCL.
  • Eliminada la anulación de perfilado de colas específica de Adreno.
  • Corregidos errores numéricos en GQA y atención enmascarada.
  • Introducida la variable de entorno GGML_OPENCL_XMEM_SDPA para controlar la función.

El lanzamiento proporciona binarios para macOS, Linux, Windows, Android y openEuler a través de backends de CPU, GPU y hardware especializado.