La versión b10208 de llama.cpp introduce soporte SYCL para la atención flash GEMM de oneMKL, permitiendo la aceleración por hardware XMX para el procesamiento de prompts. Este cambio mejora significativamente la velocidad de inferencia en las GPUs Intel Arc al utilizar núcleos MKL en lugar de la ruta TILE predeterminada.

  • Las pruebas de rendimiento muestran una aceleración de 1.97x para Gemma-4-26B (1473 t/s frente a 746 t/s) y una aceleración de 1.85x para Qwen3.6-27B (609 t/s frente a 330 t/s) en hardware B70/Battlemage.
  • La implementación corrige errores de disposición de destino entrelazado en el núcleo de normalización que anteriormente corrompían las salidas de atención para la mayoría de los modelos.
  • La atención flash MKL ahora está habilitada para todos los tipos de caché KV (F16, BF16, F32 y cuantizados), eliminando restricciones anteriores a solo cachés cuantizados.
  • Las nuevas variables de entorno permiten a los usuarios habilitar la depuración, desactivar la función o controlar los umbrales de activación mediante GGML_SYCL_ENABLE_MKL_FA.

Esta actualización proporciona reducciones sustanciales de latencia para operaciones de prefijado multi-token en hardware Intel compatible mientras mantiene la paridad de perplejidad con las implementaciones estándar.