llama.cpp 项目通过暴露目标图中的层输入张量,为 HunyuanOCR 模型添加了针对 DFlash 推测解码的支持。此更改使草稿模型能够读取残差流,从而使图像请求能够成功运行,其草稿接受率约为 0.5,且与非推测运行相比,OCR 输出字节完全一致。
此次更新还修复了与 HunYuan 目标相关的 DFlash 草稿转换问题,解决了两个特定故障:一个是由未绑定词汇表处理引起的 AttributeError,以及错误读取草稿参数而非目标配置的配置查找。这些修复确保了 tencent/HunyuanOCR DFlash 草稿在 v1.5 和 v1.0 检查点上的转换成功,且不改变基础模型转换。
这些更改使 llama.cpp 能够针对基于 Hunyuan 的模型进行高效的推测解码,在保持输出保真度的同时提高了推理速度。