Проект llama.cpp выпустил сборку b10701, которая включает исправление для моделей черновиков DFlash2 NVFP4. Обновление устраняет проблему, при которой эти модели выдавали почти не принятых спекулятивных токенов.

  • Передаёт отсутствующие масштабы NVFP4 операциям внимания в pull request #28000.
  • Обеспечивает правильную передачу масштабов проекций Q, K, V и выхода в соответствующие операции графа.

Это изменение восстанавливает корректную работу моделей DFlash2 NVFP4 за счёт исправления распространения масштабов, необходимого для спекулятивного декодирования.