O projeto llama.cpp lançou a compilação b10813, que introduz uma implementação OpenCL para GPUs Adreno usando o caminho xmem SDPA (Scaled Dot-Product Attention). Esta atualização também aborda erros numéricos nos mecanismos GQA e atenção mascarada.
- Adicionado o caminho Adreno xmem SDPA para aceleração OpenCL.
- Removida a substituição de perfilamento de fila específica do Adreno.
- Corrigidos erros numéricos no GQA e na atenção mascarada.
- Introduzida a variável de ambiente GGML_OPENCL_XMEM_SDPA para controlar o recurso.
O lançamento fornece binários para macOS, Linux, Windows, Android e openEuler através de backends de CPU, GPU e hardware especializado.