Проект llama.cpp выпустил сборку b10701, которая включает исправление для моделей черновиков DFlash2 NVFP4. Обновление устраняет проблему, при которой эти модели выдавали почти не принятых спекулятивных токенов.
- Передаёт отсутствующие масштабы NVFP4 операциям внимания в pull request #28000.
- Обеспечивает правильную передачу масштабов проекций Q, K, V и выхода в соответствующие операции графа.
Это изменение восстанавливает корректную работу моделей DFlash2 NVFP4 за счёт исправления распространения масштабов, необходимого для спекулятивного декодирования.