PaddlePaddleは、階層並列デコーディング・パラダイムを活用してスループットを向上させる軽量な10億パラメータの文書解析モデルHPD-Parsingを発表した。このアーキテクチャは、メインのレイアウトブランチを通じてグローバルなページ構造を調整しつつ、局所的なコンテンツ生成を並列ブランチにディスパッチし、プログレッシブマルチトークン予測を用いてデコーディングステップ数を削減する。

  • HPD-ParsingはOmniDocBench v1.6で総合スコア94.91%を達成し、エンドツーエンドの統一パーサーの中で新たな最先端記録を樹立した。
  • このモデルは最大スループット4,752トークン/秒(TPS)に達し、自己回帰ベースラインよりも3.06倍速く、既存の最速文書パーサーよりも2.62倍高速である。
  • 自動化された難易度認識データキュレーションを伴う段階的適応戦略により、並列デコーディングへの移行中も解析精度が維持される。

このアプローチは、文書解析が単一の逐次生成軌道ではなく、グローバルなレイアウト調整と局所的な並列デコーディングを通じて効果的に実行可能であることを示している。