研究者らは、Highlight-Then-Summarize (H2S) を提案した。これは、質問に関連する証拠を特定し、回答を生成する前にそれをコンパクトな要約に統合する「圧縮後に推論する」パラダイムである。このアプローチをサポートするために、チームは11のベンチマークファミリーから6,647例を含むH2S-Datasetを構築し、プロセスレベルの報酬のためのH2S-RLを導入した。
- H2S-14Bは、共有の128K入力と4K出力の予算下で、H2S-Benchにおいて平均スコア32.60を達成する。
- このモデルはQwen3.8-27Bを10.17ポイント上回り、評価されたオープンソースモデルの中で最も強力な総合結果を獲得した。
- H2S-14Bは、4Kの出力予算のみで16K予算のパフォーマンスの97.1%を維持しつつ、最高のEvidence-Summary Qualityスコアを達成している。
これらの結果は、証拠を明示的に選択して統合することが長期コンテキスト推論を改善し、よりコンパクトな生成を可能にすることを示している。