Бэкенд ggml-openvino для llama.cpp был обновлён до версии 2026.4.1, что привнесло оптимизации производительности, расширенную поддержку операторов и улучшенное перечисление устройств.

  • Объединение маршрутизации Mixture-of-Experts (MoE) и нормализации GDN QK, с включённым по умолчанию объединением MoE на GPU.
  • Поддержка объединённых весов gate-up в моделях типа gemma-4, что привело к увеличению пропускной способности префиллинга с 66.16 до 1608.73 t/s на Arc B390.
  • Исправление обработки оси ранга-3 при выполнении с сохранением состояния, устраняющее прерывания сборки графа для моделей MoE.
  • Реализация перечисления устройств и отчётов о памяти, соответствующих требованиям PRD, обеспечивающая точное различие между GPU и iGPU.
  • Добавление опции k-requant q4_asym64 и режима cache_only для прямого импорта скомпилированных моделей с диска.

Эти изменения улучшают производительность вывода для архитектур MoE и обеспечивают более надёжное обнаружение оборудования и конфигурацию для пользователей OpenVINO.