llama.cppプロジェクトは、ターゲットグラフ内のレイヤー入力テンソルを公開することで、HunyuanOCRモデルとのDFlash推測デコーディングのサポートを追加しました。この変更により、ドラフトモデルが残差ストリームを読み取れるようになり、非推測実行と比較して約0.5のドラフト受容率とバイトレベルで同一のOCR出力を得ながら、画像リクエストを正常に実行できるようになりました。

今回の更新では、Hunyuanターゲットに対するDFlashドラフト変換の問題も修正され、2つの特定の失敗が解消されました。1つは未束縛のvocab処理によるAttributeError、もう1つはドラフトパラメータではなくターゲット設定を正しく読み取らない構成ルックアップです。これらの修正により、ベースモデルの変換を変更せずに、v1.0およびバージョン1.5のチェックポイントに対してtencent/HunyuanOCR DFlashドラフトの変換が成功するようになりました。

これらの変更により、llama.cppでのHunyuanベースモデルの効率的な推測デコーディングが可能になり、出力の忠実度を維持しつつ推論速度が向上しました。