Проект llama.cpp выпустил сборку b11307, которая исправляет порядок входных данных слоёв, чтобы сохранить исходную последовательность батча во время спекулятивного декодирования. Это изменение гарантирует правильную поддержку порядка токенов для немаскированных вложений NextN и совместимость с разделением тензоров.

  • Восстанавливает исходный порядок строк после синхронизации путём копирования тензоров микропакетов со смещения ноль.
  • Использует отображение исходных токенов для немаскированных строк NextN, даже когда захват входных данных слоя отключён.
  • Исправляет проблемы с резервированием WebGPU и захватом скрытых состояний OpenVINO.
  • Проходит валидацию на 256 конфигурациях CPU/CUDA/тензоров, при этом Qwen3.8-27B завершает MT-Bench при конкурентности 16.

Обновление обеспечивает корректность рабочих процессов спекулятивного декодирования, предотвращая искажение порядка входных данных слоёв и вложений.