Проект llama.cpp выпустил сборку b10174, внедряющую поддержку спекулятивного декодирования NextN/MTP для архитектуры модели GLM_DSA (GLM-5.2).

  • Добавляет GLM-5.2 NextN/MTP в качестве цели --spec-type draft-mtp, обеспечивая плотное внимание MLA и настройку контекстного KV для MTP.
  • Обновляет скрипт конвертации для поддержки экспорта --mtp/--no-mtp для GlmMoeDsaForCausalLM, позволяя пользователям исключать или сохранять блок NextN при экспорте.
  • Предоставляет предварительно собранные бинарные файлы для macOS (Apple Silicon и Intel), Linux (CPU, Vulkan, ROCm, OpenVINO, SYCL), Android, Windows (CPU, CUDA 12/13, Vulkan, OpenCL, ROCm, SYCL) и платформ openEuler.

Это обновление позволяет ускорить скорость вывода для моделей GLM-5.2 за счет использования техник спекулятивного декодирования в рамках фреймворка llama.cpp.