Исследователи предлагают Highlight-Then-Summarize (H2S), парадигму «сжать, затем рассуждать», которая выявляет релевантные вопросу доказательства и интегрирует их в компактное резюме перед генерацией ответа. Для поддержки этого подхода команда создала H2S-Dataset с 6 647 примерами из 11 семейств бенчмарков и представила H2S-RL для вознаграждений на уровне процесса.

  • H2S-14B достигает среднего балла 32,60 на H2S-Bench при общем бюджете ввода в 128K и вывода в 4K.
  • Модель превосходит Qwen3.8-27B на 10,17 балла, обеспечивая лучший общий результат среди оцененных моделей с открытым исходным кодом.
  • H2S-14B сохраняет 97,1% своей производительности при бюджете в 16K, имея только бюджет вывода в 4K, одновременно достигая наивысшего балла за качество Evidence-Summary.

Эти результаты демонстрируют, что явный выбор и интеграция доказательств улучшают рассуждение с длинным контекстом, позволяя генерировать более компактные ответы.