La Optimización de Política en la Zona Próxima (ZPPO) integra el conocimiento del maestro directamente en los prompts en lugar de en los gradientes de la política. Utiliza Preguntas Candidatas Binarias y Negativas para exponer los modos de fallo del estudiante y amplifica el aprendizaje a través de un búfer de repetición de prompts, logrando un rendimiento superior en preguntas difíciles a lo largo de las escalas del estudiante, especialmente en tamaños de modelo más pequeños.
ZPPO: El maestro en los prompts, no en los gradientes
HydraHead: Atención híbrida a nivel de cabezal para rendimiento en contexto largo
HydraHead introduce una hibridación a nivel de cabezal de Full Attention y Linear Attention, aprovechando la interpretabilidad para seleccionar los cabezales críticos para recuperación y fusionar las salidas mediante un módulo normalizado por escala. Entrenado con 15B tokens, logra más del 69% de mejora sobre la línea base en una longitud de contexto de 512K, superando a los híbridos a nivel de capa y acercándose al rendimiento de Qwen3.5 en tareas de contexto largo.
MAST permite el olvido selectivo en el razonamiento inducido por RLVR
MAST, un método de olvido guiado por mecanismos, logra el olvido dirigido del razonamiento inducido por RLVR con daños colaterales mínimos. En Qwen2.5-Math-1.5B y Qwen3-1.7B-Base, reduce significativamente el rendimiento en MATH (de 45/150 a 37/15-0) mientras preserva la precisión de GSM8K en +0.8 puntos y mantiene la retención de MATH en -0.5 puntos. Los resultados se mantienen consistentes entre diferentes semillas, objetivos y modelos, mostrando una estabilidad superior frente al olvido de parámetros completos.
MAST permite el olvido selectivo en el razonamiento inducido por RLVR
MAST, un método de olvido guiado por mecanismos, logra el olvido dirigido del razonamiento inducido por RLVR con daños colaterales mínimos. En Qwen2.5-Math-1.5B y Qwen3-1.7B-Base, reduce significativamente el rendimiento en MATH (de 45/150 a 37/15-0) mientras preserva la precisión de GSM8K en +0.8 puntos y mantiene la retención de MATH en -0.5 puntos. Los resultados se mantienen consistentes entre semillas, objetivos y modelos, mostrando una estabilidad superior frente al olvido de parámetros completos.
GSM-Plus-BN presenta un benchmark basado en perturbaciones para el razonamiento matemático en bengalí
El estudio introduce GSM-Plus-BN, un nuevo conjunto de datos matemáticos en bengalí perturbado derivado del benchmark GSM-Plus en inglés y verificado por traductores humanos. Este recurso aborda la falta de benchmarks sistemáticos para evaluar la robustez de los modelos en regiones lingüísticamente diversas como Bangladés.
CARE-PPO permite el aprendizaje conjunto de predicciones precisas y confianza confiable en tareas cuantitativas basadas en lenguaje
Los investigadores presentan CARE-PPO, un marco de aprendizaje por refuerzo que conecta la predicción de pérdida para estimación de incertidumbre con el ajuste fino PPO actor-crítico. Este enfoque permite el aprendizaje conjunto de estimaciones numéricas precisas y señales de confianza confiables en la predicción cuantitativa basada en lenguaje a partir de entradas no estructuradas.