Проект llama.cpp выпустил версию 0.4.1, добавив поддержку тернарной архитектуры Mixture of Experts Maple 20B-A1B на CPU, а также предварительную поддержку моделей Tencent Hy 4 и Spark2.5.

  • Добавлена поддержка тернарной архитектуры MoE Maple 20B-A1B (CPU).
  • Добавлена предварительная поддержка архитектуры Tencent Hy 4 (hy_v4).
  • Добавлена поддержка модели Spark2.5.
  • Обновлен ggml до версии v0.24.0, расширено покрытие бэкендов и повышена надежность с новым API управления точностью.
  • Улучшена обработка JSON-схем путем рефакторинга с использованием внутреннего представления common_schema.
  • Специализированные парсеры чата разделены в папку common/parsers, добавлено структурированное логирование JSONL через --log-jsonl.
  • Исправлено выделение контекстного KV-кэша для MTP в моделях DeepSeek2, GLM-MoE и связанных моделях.
  • Исправлена нормализация GDN с max на rsqrt для затронутых моделей Qwen/Kimi/GLM.

Это обновление позволяет запускать новые архитектуры моделей и повышает стабильность благодаря исправленной нормализации, выделению кэша и управлению дочерними процессами сервера.