Los investigadores proponen Highlight-Then-Summarize (H2S), un paradigma de compresión-razonamiento que identifica la evidencia relevante a la pregunta y la integra en un resumen compacto antes de generar una respuesta. Para apoyar este enfoque, el equipo construyó H2S-Dataset con 6.647 ejemplos de 11 familias de benchmarks e introdujo H2S-RL para recompensas a nivel de proceso.
- H2S-14B logra un puntaje promedio de 32,60 en H2S-Bench bajo un presupuesto compartido de entrada de 128K y salida de 4K.
- El modelo supera a Qwen3.8-27B por 10,17 puntos, asegurando el mejor resultado general entre los modelos de código abierto evaluados.
- H2S-14B conserva el 97,1% de su rendimiento con presupuesto de 16K con solo un presupuesto de salida de 4K mientras logra la puntuación más alta en Calidad de Evidencia-Resumen.
Estos resultados demuestran que seleccionar e integrar explícitamente la evidencia mejora el razonamiento de contexto largo y permite una generación más compacta.