研究者らは、質問に関連する証拠を特定し、回答を生成する前にそれをコンパクトな要約に統合する圧縮後推論パラダイムであるHighlight-Then-Summarize (H2S) を提案した。チームは6,647件の例を含むH2S-Datasetを構築し、証拠選択に対するプロセスレベルの報酬を提供するH2S-RLを導入した。

  • H2S-14Bは、共有された128K入力と4K出力の制約下で、7つのタスクからなるH2S-Benchスイートにおいて平均32.60のスコアを達成した。
  • このモデルはQwen3.8-27Bを10.17ポイント上回り、評価されたオープンソースモデルの中で最も強力な総合結果を得た。
  • H2S-14Bは、4K出力の制約のみで16K予算時のパフォーマンスの97.1%を維持しつつ、最高のEvidence-Summary Qualityスコアを達成した。

これらの結果は、証拠を明示的に選択して統合することが長期コンテキスト推論を改善し、よりコンパクトな生成を可能にすることを示している。