A versão b10208 do llama.cpp introduz suporte SYCL para flash attention GEMM oneMKL, permitindo aceleração por hardware XMX no processamento de prompts. Essa alteração melhora significativamente a velocidade de inferência em GPUs Intel Arc ao utilizar kernels MKL em vez do caminho TILE padrão.
- Os benchmarks de desempenho mostram um aumento de velocidade de 1,97x para Gemma-4-26B (1473 t/s vs 746 t/s) e de 1,85x para Qwen3.6-27B (609 t/s vs 330 t/s) no hardware B70/Battlemage.
- A implementação corrige bugs no layout entrelaçado do destino no kernel de normalização que anteriormente corrompiam as saídas de atenção para a maioria dos modelos.
- O flash attention MKL agora está habilitado para todos os tipos de cache KV (F16, BF16, F32 e quantizado), removendo restrições anteriores que limitavam o uso apenas a caches quantizados.
- Novas variáveis de ambiente permitem que os usuários ativar a depuração, desativar o recurso ou controlar os limiares de ativação por meio de GGML_SYCL_ENABLE_MKL_FA.
Esta atualização proporciona reduções substanciais na latência para operações de pré-preenchimento de múltiplos tokens em hardware Intel compatível, mantendo a paridade de perplexidade com implementações padrão.