Проект llama.cpp добавил поддержку спекулятивного декодирования DFlash с моделью HunyuanOCR, открывая тензоры входных данных слоёв в целевом графе. Это изменение позволяет модели-черновику считывать остаточные потоки, что обеспечивает успешное выполнение запросов на распознавание текста с уровнем принятия черновика около 0.5 и байтово идентичным выводом OCR по сравнению с неспекулятивными запусками.

Обновление также исправляет конвертацию черновиков DFlash для целей HunYuan, устраняя два конкретных сбоя: AttributeError из-за необработанного словаря и поиск конфигураций, которые ошибочно считывали параметры черновика вместо настроек целевой модели. Эти исправления гарантируют успешную конвертацию черновиков DFlash tencent/HunyuanOCR для контрольных точек версий 1.5 и v1.0 без изменения базовых преобразований моделей.

Эти изменения обеспечивают эффективное спекулятивное декодирование для моделей на основе Hunyuan в llama.cpp, повышая скорость вывода при сохранении точности результата.