Проект llama.cpp выпустил версию b11460, которая добавляет поддержку формата квантования IQ3_S multi-column MMVQ в его бэкенде SYCL. Это обновление включено в новый билд наряду со стандартными опциями ускорения CPU и GPU.
- Релиз добавляет поддержку IQ3_S multi-column MMVQ в реализацию SYCL через pull request #29500.
- Бинарные файлы предоставлены для macOS (Apple Silicon и Intel), Linux (x64, arm64, s390x), Windows, Android и openEuler.
Ускорение GPU доступно через CUDA 12/13, Vulkan, ROCm 10.0, OpenVINO и OpenCL Adreno на поддерживаемых платформах.
- Специальные сборки включены для устройств Snapdragon на Linux и Android, поддерживающих CPU, GPU Adreno и NPU Hexagon.
Этот релиз позволяет пользователям получить доступ к последним оптимизациям SYCL и расширяет совместимость оборудования для запуска моделей llama.cpp на различных архитектурах.