Проект llama.cpp выпустил сборку b11330, которая внедряет поддержку предсказания нескольких токенов (MTP) специально для модели Qwen4Exp. Это обновление является частью более широкого выпуска, который предоставляет бинарные файлы для macOS, Linux, Windows, Android и iOS на различных аппаратных бэкендах.

  • Добавляет функциональность MTP для моделей Qwen4Exp через pull request #29761.
  • Удаляет член `has_state` в пользу проверки того, что `ctx_bufs` не пустой.
  • Включает очистку кода с последовательными соглашениями об именовании и уменьшенной избыточностью комментариев.
  • Предоставляет предварительно собранные бинарные файлы для CPU, GPU (CUDA, Vulkan, ROCm, OpenCL) и NPU (Snapdragon Hexagon).

Этот выпуск позволяет пользователям использовать возможности MTP в llama.cpp, сохраняя совместимость с существующими аппаратными конфигурациями.