Проект llama.cpp выпустил сборку b10988, внося изменения в бэкенд OpenCL специально для моделей Mixture of Experts (MoE). Обновление реализует логику выбора умножения матриц экспертов MoE на основе размера пакета во время спекулятивного декодирования и предсказания нескольких токенов.
- Блокировать предварительно собранную операцию GEMM q4_0 MoE в зависимости от количества маршрутизации.
- Прекратить запись нулей в заполненные слои активации MoE для повышения эффективности.
- Предоставить бинарные файлы для macOS, Linux, Windows, Android и openEuler для платформ CPU, CUDA, ROCm, Vulkan, OpenVINO, SYCL и Adreno.