Проект llama.cpp выпустил версию b10203, которая вводит поддержку формата квантования q2_0 в операциях умножения матриц на базе SYCL. Это обновление расширяет совместимость библиотеки для конкретных сценариев аппаратного ускорения.
- Добавлена поддержка q2_0 в mul_mat через PR #26231.
- Расширено покрытие дополнительных случаев q2_0 внутри бэкенда SYCL.
- Предоставлены бинарные файлы для macOS (Apple Silicon и Intel), iOS, Linux (CPU, Vulkan, ROCm 7.2, OpenVINO, SYCL FP32/FP16), Android, Windows (CPU, OpenCL, CUDA 12/13, Vulkan, OpenVINO, SYCL, HIP) и openEuler.
Релиз позволяет пользователям использовать квантование q2_0 на устройствах, совместимых с SYCL, расширяя диапазон поддерживаемых аппаратных конфигураций для эффективного вывода моделей.