llama.cpp 프로젝트는 타겟 그래프에서 레이어 입력 텐서를 노출하여 HunyuanOCR 모델과 함께 DFlash 추측 디코딩에 대한 지원을 추가했습니다. 이 변경 사항으로 드래프트 모델이 잔류 스트림을 읽을 수 있게 되어, 비추측 실행과 비교할 때 약 0.5의 드래프트 수용률과 바이트 단위로 동일한 OCR 출력을 유지하며 이미지 요청을 성공적으로 실행할 수 있습니다.
업데이트는 또한 HunYuan 타겟에 대한 DFlash 드래프트 변환을 수정하여 두 가지 특정 오류를 해결했습니다: 바운드되지 않은 어휘 처리로 인한 AttributeError와 드래프트 매개변수가 아닌 타겟 구성을 잘못 읽는 구성 조회 문제입니다. 이 수정 사항들은 기본 모델 변환을 변경하지 않고 버전 1.5 및 v1.0 체크포인트 모두에서 tencent/HunyuanOCR DFlash 드래프트 변환이 성공하도록 보장합니다.
이러한 변경 사항은 llama.cpp에서 Hunyuan 기반 모델에 대한 효율적인 추측 디코딩을 가능하게 하여 출력 충실도를 유지하면서 추론 속도를 향상시킵니다.