연구자들은 질문 관련 증거를 식별하고 답변을 생성하기 전에 이를 압축된 요약에 통합하는 압축 후 추론 패러다임인 Highlight-Then-Summarize(H2S)를 제안했다. 이 접근 방식을 지원하기 위해 연구진은 11개 벤치마크 패밀리에서 6,647개의 예제를 포함한 H2S-Dataset을 구축하고 프로세스 수준 보상을 위한 H2S-RL을 도입했다.
- 공유된 128K 입력 및 4K 출력 예산 하에서 H2S-Bench에서 평균 점수 32.60을 달성한다.
- Qwen3.8-27B보다 10.17점 더 우수하여 평가된 오픈소스 모델 중 가장 강력한 전체 결과를 기록했다.
- 4K 출력 예산만으로 16K 예산 성능의 97.1%를 유지하면서 Evidence-Summary Quality 점수에서 최고치를 달성했다.
이 결과는 증거를 명시적으로 선택하고 통합하는 것이 긴 문맥 추론을 개선하면서도 더 압축된 생성을 가능하게 함을 보여준다.