В релизе llama.cpp b10256 включено изменение, позволяющее распараллелить ядро неконгруэнтного конкатенирования для устройств SYCL. Обновление изменяет геометрию запуска с однополосной рабочей группы на ту, которая использует `SYCL_CONCAT_BLOCK_SIZE`.

  • Ядро неконгруэнтного конкатенирования SYCL теперь запускает более широкую рабочую группу для улучшения параллелизма.
  • Тесты на Arc Pro B70 с Qwen3.6-27B показывают увеличение пропускной способности на 9,4% (с 920 до 1006 ток/с).
  • Релиз предоставляет бинарные файлы для macOS, Linux, Windows, Android и openEuler для бэкендов CPU, CUDA, Vulkan, ROCm, OpenVINO и SYCL.

Эта оптимизация улучшает производительность вывода на графических процессорах Intel с использованием бэкенда SYCL.