연구자들은 질문 관련 증거를 식별하고 답변을 생성하기 전에 이를 컴팩트한 요약에 통합하는 압축 후 추론 패러다임인 Highlight-Then-Summarize(H2S)를 제안합니다. 연구진은 6,647개의 예제로 구성된 H2S-Dataset을 구축하고 증거 선택에 대한 프로세스 수준 보상을 제공하는 H2S-RL을 소개합니다.
- 공유된 128K 입력 및 4K 출력 예산 하에서 H2S-14B는 일곱 가지 과제로 구성된 H2S-Bench 스위트에서 평균 점수 32.60을 달성합니다.
- 이 모델은 Qwen3.8-27B보다 10.17점 더 우수하며, 평가된 오픈소스 모델 중 가장 우수한 전반적인 결과를 얻었습니다.
- H2S-14B는 4K 출력 예산만으로 16K 예산 성능의 97.1%를 유지하면서 가장 높은 Evidence-Summary Quality 점수를 달성합니다.
이러한 결과는 증거를 명시적으로 선택하고 통합하는 것이 장기 문맥 추론을 개선하면서도 더 컴팩트한 생성을 가능하게 함을 보여줍니다.