Проект llama.cpp выпустил версию b10795, которая включает новую оптимизацию для бэкенда SYCL. Это обновление позволяет объединять цепочки RMS_NORM+MUL+ADD и ADD+ADD residual под флагом GGML_SYCL_ENABLE_FUSION.

  • Объединённая операция ADD+ADD повторно использует ту же индексацию broadcast и матрицу типов, что и отдельная функция add(), поддерживая f32, f16, i32, i16, bf16 и неконтейгуированные данные.
  • Неподдерживаемые комбинации в логике слияния возвращаются к двум отдельным запускам add() для сохранения совместимости.

Этот релиз предоставляет бинарные файлы для macOS, Linux, Windows, Android и openEuler на различных аппаратных ускорителях, включая CUDA, ROCm, Vulkan и OpenVINO.