शोधकर्ताओं ने Highlight-Then-Summarize (H2S) का प्रस्ताव रखा, जो एक compress-then-reason परिप्रेक्ष्य है जो प्रश्न-संबंधी प्रमाण की पहचान करता है और उत्तर उत्पन्न करने से पहले उसे एक संक्षिप्त सारांश में एकीकृत करता है। इस दृष्टिकोण का समर्थन करने के लिए, टीम ने 11 बेंचमार्क परिवारों से 6,647 उदाहरणों के साथ H2S-Dataset तैयार किया और प्रक्रिया-स्तर के पुरस्कारों के लिए H2S-RL पेश किया।

  • साझा 128K इनपुट और 4K आउटपुट बजट के तहत H2S-Bench पर H2S-14B ने औसत स्कोर 32.60 हासिल किया।
  • मॉडल Qwen3.8-27B से 10.17 अंक आगे है, जिसने मूल्यांकन किए गए सभी ओपन-सोर्स मॉडलों में सबसे मजबूत समग्र परिणाम हासिल किया।
  • H2S-14B केवल 4K आउटपुट बजट के साथ अपने 16K-बजट प्रदर्शन का 97.1% बनाए रखता है, जबकि यह सबसे उच्च Evidence-Summary Quality स्कोर भी हासिल करता है।

ये परिणाम दिखाते हैं कि स्पष्ट रूप से प्रमाण का चयन और एकीकरण लंबे-संदर्भ तर्क को बेहतर बनाता है, साथ ही अधिक संक्षिप्त उत्पन्न करने की सुविधा भी देता है।