Проект llama.cpp выпустил сборку b10868, которая внедряет обработку типов IQ для моделей Mixture of Experts (MoE).
- Добавлена поддержка типов квантования IQ в архитектурах MoE через pull request #28476.
- Предоставлены бинарные файлы для macOS (Apple Silicon и Intel), Linux (CPU, Vulkan, ROCm, OpenVINO, SYCL), Windows (CPU, CUDA 12/13, Vulkan, OpenCL, ROCm, SYCL), Android и openEuler.
- Включена поддержка iOS XCFramework и автономный пакет пользовательского интерфейса.
Это обновление позволяет пользователям запускать модели MoE с определенными типами квантования IQ на широком спектре аппаратных платформ.