Проект llama.cpp выпустил сборку b10868, которая внедряет обработку типов IQ для моделей Mixture of Experts (MoE).

  • Добавлена поддержка типов квантования IQ в архитектурах MoE через pull request #28476.
  • Предоставлены бинарные файлы для macOS (Apple Silicon и Intel), Linux (CPU, Vulkan, ROCm, OpenVINO, SYCL), Windows (CPU, CUDA 12/13, Vulkan, OpenCL, ROCm, SYCL), Android и openEuler.
  • Включена поддержка iOS XCFramework и автономный пакет пользовательского интерфейса.

Это обновление позволяет пользователям запускать модели MoE с определенными типами квантования IQ на широком спектре аппаратных платформ.