Le projet llama.cpp a ajouté le support du décodage spéculatif DFlash avec le modèle HunyuanOCR en exposant les tenseurs d'entrée des couches dans le graphe cible. Ce changement permet au modèle de brouillon de lire les flux résiduels, permettant aux requêtes d'image de s'exécuter avec succès avec un taux d'acceptation du brouillon d'environ 0,5 et une sortie OCR identique en octets par rapport aux exécutions non spéculatives.
La mise à jour corrige également la conversion des brouillons DFlash par rapport aux cibles HunYuan, résolvant deux échecs spécifiques : un AttributeError causé par la gestion du vocabulaire non lié et des recherches de configuration qui lisaient incorrectement les paramètres du brouillon au lieu des configurations cibles. Ces corrections garantissent que la conversion des brouillons DFlash tencent/HunyuanOCR réussit pour les points de contrôle version 1.5 et v1.0 sans altérer les conversions des modèles de base.
Ces modifications permettent un décodage spéculatif efficace pour les modèles basés sur Hunyuan dans llama.cpp, améliorant la vitesse d'inférence tout en maintenant la fidélité de la sortie.