Проект llama.cpp объединил значительные обновления в свой бэкенд OpenVINO, главным образом включив поддержку семейства моделей Qwen3.5 и внедрив несколько методов оптимизации памяти.

  • Включены операции GPT-OSS MoE, MXFP4, FILL, SIGMOID, SQR, SQRT и multi-dim set rows.
  • Исправлены проблемы с точностью в архитектурах Gemma3n, Phi-3-mini (NEOX RoPE), MPT, Kimi-linear и Minimax-m3.
  • Реализована GGML_OPENVINO_RELEASE_WEIGHTS для освобождения RSS хоста после компиляции, что снижает использование памяти в стабильном состоянии с ~1555 МБ до ~710 МБ для Llama-3.2-1B-Q4_K_M на Arc iGPU.
  • Добавлена потоковая переквантизация весов для снижения пикового RSS во время компиляции на 1,06 ГБ для моделей на 1B и на 2,0 ГБ для моделей на 8B.
  • Введен кэш фронтенда моделей (GGML_OPENVINO_MODEL_CACHE_DIR) для пропуска преобразования графа и компиляции при повторных загрузках.

Эти изменения улучшают совместимость с новыми архитектурами, такими как Qwen3.5, и значительно сокращают как временные затраты памяти во время компиляции, так и потребление памяти в стабильном состоянии при инференсе на GPU.