Исследователи предлагают Highlight-Then-Summarize (H2S), парадигму «сжать, затем рассуждать», которая выявляет релевантные вопросу доказательства и интегрирует их в компактное резюме перед генерацией ответа. Команда создала H2S-Dataset с 6 647 примерами и представила H2S-RL для предоставления вознаграждений на уровне процесса для выбора доказательств.

  • H2S-14B достигает среднего балла 32,60 на наборе из семи задач H2S-Bench при общем бюджете ввода 128K и вывода 4K.
  • Модель превосходит Qwen3.8-27B на 10,17 балла, показывая наилучший общий результат среди оцененных моделей с открытым исходным кодом.
  • H2S-14B сохраняет 97,1% своей производительности при бюджете вывода 16K, используя только бюджет вывода 4K, одновременно достигая наивысшего балла по качеству Evidence-Summary.

Эти результаты демонстрируют, что явный выбор и интеграция доказательств улучшают рассуждение в длинном контексте, позволяя получать более компактную генерацию.