Проект llama.cpp выпустил версию b11460, которая добавляет поддержку формата квантования IQ3_S multi-column MMVQ в его бэкенде SYCL. Это обновление включено в новый билд наряду со стандартными опциями ускорения CPU и GPU.

  • Релиз добавляет поддержку IQ3_S multi-column MMVQ в реализацию SYCL через pull request #29500.
  • Бинарные файлы предоставлены для macOS (Apple Silicon и Intel), Linux (x64, arm64, s390x), Windows, Android и openEuler.

Ускорение GPU доступно через CUDA 12/13, Vulkan, ROCm 10.0, OpenVINO и OpenCL Adreno на поддерживаемых платформах.

  • Специальные сборки включены для устройств Snapdragon на Linux и Android, поддерживающих CPU, GPU Adreno и NPU Hexagon.

Этот релиз позволяет пользователям получить доступ к последним оптимизациям SYCL и расширяет совместимость оборудования для запуска моделей llama.cpp на различных архитектурах.