Бэкенд ggml-openvino для llama.cpp был обновлён до версии 2026.4.1, что привнесло оптимизации производительности, расширенную поддержку операторов и улучшенное перечисление устройств.
- Объединение маршрутизации Mixture-of-Experts (MoE) и нормализации GDN QK, с включённым по умолчанию объединением MoE на GPU.
- Поддержка объединённых весов gate-up в моделях типа gemma-4, что привело к увеличению пропускной способности префиллинга с 66.16 до 1608.73 t/s на Arc B390.
- Исправление обработки оси ранга-3 при выполнении с сохранением состояния, устраняющее прерывания сборки графа для моделей MoE.
- Реализация перечисления устройств и отчётов о памяти, соответствующих требованиям PRD, обеспечивающая точное различие между GPU и iGPU.
- Добавление опции k-requant q4_asym64 и режима cache_only для прямого импорта скомпилированных моделей с диска.
Эти изменения улучшают производительность вывода для архитектур MoE и обеспечивают более надёжное обнаружение оборудования и конфигурацию для пользователей OpenVINO.