Проект llama.cpp выпустил сборку b10322, которая включает оптимизацию производительности, объединяющую загрузки окон SSM_CONV в бэкенде SYCL.

  • На Arc Pro B70 чередующиеся тесты A/B показали ускорение от 1.85x до 1.87x для определенных форм тензоров, с пренебрежимо малыми изменениями при n_t=1.
  • Бенчмарки на моделях Qwen35 27B Q4_K - Medium, использующих ssm_conv в 48 из 64 блоков, показали улучшение времени обработки запроса на +2.2%.
  • Релиз предоставляет бинарные файлы для macOS (Apple Silicon и Intel), iOS, Linux (CPU, Vulkan, ROCm, OpenVINO, SYCL), Android, Windows (CPU, CUDA, Vulkan, OpenVINO, SYCL, HIP) и openEuler.

Это обновление улучшает пропускную способность вывода для рабочих нагрузок, использующих операции SSM_CONV на совместимом оборудовании.