Los investigadores proponen Highlight-Then-Summarize (H2S), un paradigma de compresión-antes-de-razonar que identifica la evidencia relevante para la pregunta y la integra en un resumen compacto antes de generar una respuesta. El equipo construye H2S-Dataset con 6,647 ejemplos e introduce H2S-RL para proporcionar recompensas a nivel de proceso para la selección de evidencia.
- H2S-14B logra una puntuación promedio de 32.60 en el conjunto H2S-Bench de siete tareas bajo un presupuesto compartido de entrada de 128K y salida de 4K.
- El modelo supera a Qwen3.8-27B por 10.17 puntos, obteniendo el mejor resultado general entre los modelos de código abierto evaluados.
- H2S-14B conserva el 97.1% de su rendimiento con presupuesto de 16K con solo un presupuesto de salida de 4K mientras logra la puntuación más alta en Calidad de Evidencia-Resumen.
Estos resultados demuestran que seleccionar e integrar evidencia explícitamente mejora el razonamiento de contexto largo y permite una generación más compacta.