Релиз llama.cpp b10208 вводит поддержку SYCL для oneMKL GEMM flash attention, обеспечивая аппаратное ускорение XMX при обработке промптов. Это изменение значительно повышает скорость вывода на графических процессорах Intel Arc за счёт использования ядер MKL вместо стандартного пути TILE.

  • Результаты бенчмарков показывают ускорение в 1.97 раза для Gemma-4-26B (1473 t/s против 746 t/s) и в 1.85 раза для Qwen3.6-27B (609 t/s против 330 t/s) на оборудовании B70/Battlemage.
  • Реализация исправляет ошибки чередования расположения выходных данных в ядре нормализации, которые ранее приводили к искажению результатов внимания для большинства моделей.
  • MKL flash attention теперь включён для всех типов KV-кэша (F16, BF16, F32 и квантованных), устраняя предыдущие ограничения только для квантованных кэшей.
  • Новые переменные окружения позволяют пользователям включать отладку, отключать функцию или управлять порогами активации через GGML_SYCL_ENABLE_MKL_FA.

Это обновление обеспечивает существенное снижение задержек при операциях префиллинга нескольких токенов на совместимом оборудовании Intel, сохраняя паритет перплексии со стандартными реализациями.