Выпуск llama.cpp b10981 устраняет критические проблемы корректности в пути декодирования с состоянием бэкенда OpenVINO, конкретно исправляя поддержку моделей вроде Gemma-4, использующих размеры голов на слой. Он также вносит оптимизации для вывода GPU Mixture of Experts (MoE) и улучшает производительность через перераспределение состояния KV.

  • Исправляет сбои декодирования с состоянием для Gemma-4 за счёт корректной обработки количества голов типа слоя и слоёв скользящего окна.
  • Улучшает производительность декодирования с состоянием на GPU, при этом gemma-4-12B увеличивает скорость с 6.27 до 9.11 t/s при глубине 8192.
  • Добавляет поддержку GGML_OPENVINO_REQUANT_KQUANT для выбора цели переквантования в 4 бита и GGML_OPENVINO_SPILL_DIR для сброса весовых буферов на диск.
  • Оптимизирует вывод GPU MoE путём слияния блока эксперта в MOECompressed и переквантования сгруппированных экспертов 8 бит.
  • Включает модели кодировщика без кэша на NPU, принимая упакованные представления RoPE QKV и обнаруживая внимание без кэша по маскам.
  • Исправляет операции ADD/SWIGLU_CLAMP смешанного типа данных путём приведения несовпадающих типов операндов к f32 для сохранения точности.

Эти изменения обеспечивают точный вывод для сложных архитектур моделей, таких как Gemma-4, одновременно предоставляя измеримое ускорение для задач декодирования с состоянием и MoE на совместимом оборудовании.