Pesquisadores propõem o Highlight-Then-Summarize (H2S), um paradigma de compressão-então-raciocínio que identifica evidências relevantes à pergunta e as integra em um resumo compacto antes de gerar uma resposta. Para apoiar essa abordagem, a equipe construiu o H2S-Dataset com 6.647 exemplos de 11 famílias de benchmarks e introduziu o H2S-RL para recompensas em nível de processo.

  • O H2S-14B alcança uma pontuação média de 32,60 no H2S-Bench sob um orçamento compartilhado de entrada de 128K e saída de 4K.
  • O modelo supera o Qwen3.8-27B em 10,17 pontos, garantindo o melhor resultado geral entre os modelos de código aberto avaliados.
  • O H2S-14B retém 97,1% de seu desempenho com orçamento de 16K apenas com um orçamento de saída de 4K, enquanto alcança a maior pontuação de Qualidade do Resumo de Evidências.

Esses resultados demonstram que a seleção explícita e a integração de evidências melhoram o raciocínio em contexto longo, permitindo uma geração mais compacta.