Para peneliti mengusulkan Highlight-Then-Summarize (H2S), sebuah paradigma kompresi-terus-alasan yang mengidentifikasi bukti relevan dengan pertanyaan dan mengintegrasikannya ke dalam ringkasan kompak sebelum menghasilkan jawaban. Untuk mendukung pendekatan ini, tim membangun H2S-Dataset dengan 6.647 contoh dari 11 keluarga benchmark dan memperkenalkan H2S-RL untuk imbalan tingkat proses.
- H2S-14B mencapai skor rata-rata 32,60 pada H2S-Bench di bawah anggaran input 128K dan output 4K yang sama.
- Model ini mengungguli Qwen3.8-27B sebesar 10,17 poin, mengamankan hasil keseluruhan terkuat di antara model sumber terbuka yang dievaluasi.
- H2S-14B mempertahankan 97,1% dari kinerjanya dengan anggaran 16K hanya dengan anggaran output 4K sambil mencapai skor Kualitas Ringkasan-Bukti tertinggi.
Hasil-hasil ini menunjukkan bahwa pemilihan dan integrasi bukti secara eksplisit meningkatkan penalaran konteks panjang sekaligus memungkinkan generasi yang lebih kompak.