El proyecto llama.cpp ha añadido soporte para la decodificación especulativa DFlash con el modelo HunyuanOCR, exponiendo los tensores de entrada de las capas en el grafo objetivo. Este cambio permite que el modelo de borrador lea los flujos residuales, lo que posibilita que las solicitudes de imagen se ejecuten correctamente con una tasa de aceptación del borrador de aproximadamente 0.5 y una salida OCR idéntica a nivel de bytes en comparación con las ejecuciones no especulativas.

La actualización también corrige la conversión del borrador DFlash frente a los objetivos HunYuan, resolviendo dos fallos específicos: un AttributeError causado por el manejo de vocabulario no vinculado y búsquedas de configuración que leían incorrectamente los parámetros del borrador en lugar de las configuraciones objetivo. Estas correcciones aseguran que la conversión de los borradores DFlash tencent/HunyuanOCR tenga éxito tanto para los puntos de control v1.5 como v1.0, sin alterar las conversiones del modelo base.

Estos cambios permiten una decodificación especulativa eficiente para modelos basados en Hunyuan en llama.cpp, mejorando la velocidad de inferencia mientras se mantiene la fidelidad de la salida.