La Auto-Distilación Condicionada por Rúbrica introduce un marco que utiliza rúbricas estructuradas para proporcionar retroalimentación a nivel de token y de alta granularidad durante la auto-distilación de modelos de lenguaje de razonamiento. Al condicionar los modelos maestros en criterios a nivel de rúbrica, permite una asignación de crédito más precisa que las recompensas escalares, superando a GRPO y OPSD en 1.0 y 0.9 puntos, respectivamente, en promedio en benchmarks de razonamiento científico.
Marco de Auto-Distilación Condicionada por Rúbrica
Marco de Auto-Distilación Condicionada por Rúbrica
La Auto-Distilación Condicionada por Rúbrica introduce un marco que utiliza rúbricas estructuradas para proporcionar retroalimentación a nivel de token y de alta granularidad durante la auto-distilación de modelos de lenguaje de razonamiento. Al condicionar los modelos maestro en criterios a nivel de rúbrica, permite una asignación de crédito más precisa que las recompensas escalares, superando a GRPO y OPSD por 1.0 y 0.9 puntos en promedio en benchmarks de razonamiento científico.
Taxonomía causal-unificada de origen para desplazamientos distribucionales en RL
Este artículo presenta una taxonomía unificada de origen causal que clasifica los desplazamientos distribucionales en el aprendizaje por refuerzo en fuentes internas, impulsadas por el agente, y externas, impulsadas por el entorno. Unifica la generalización ID/OOD y los entornos no estacionarios al encuadrar los desplazamientos como cambios estructurados en el proceso de interacción agente-entorno, utilizando una descomposición POMDP y una perspectiva de frontera de tiempo desplazado.
HABC mejora el ajuste fino de RL en VLA con resultados dispersos
El Clonamiento de Comportamiento Jerárquico Ponderado por Ventaja (HABC) mejora el ajuste fino de RL en línea para agentes de visión y lenguaje mediante el uso de cabezales de crítico separados para viabilidad y eficiencia. Combina sus salidas a través de una puerta adaptativa al estado y aplica pesos por transición, mientras que la asignación de crédito consciente de intervenciones evita la fuga de supervisión. En experimentos con robots reales, HABC aumenta las tasas de éxito hasta 92%, 88% y 38% en tres tareas bimanuales, superando los lineamientos base de SFT de 36%, 44% y 12%.
H-RePlan: Recuperación jerárquica para sistemas de agentes multi-dispositivo
H-RePlan introduce un marco de replanificación jerárquica que separa la recuperación de estrategias locales del dispositivo de la replanificación global del orquestador. Supera a las líneas base existentes al lograr una mayor tasa de finalización y adherencia a las instrucciones, con menor costo en tokens, mediante una recuperación consciente del alcance en sistemas de agentes multi-dispositivo.
Lean como Oráculo de Recompensa Verificado por Proceso en RL para Demostración de Teoremas
Este trabajo muestra que Lean puede servir como un oráculo simbólico de proceso, proporcionando retroalimentación fina y verificada durante el aprendizaje por refuerzo. Al analizar los intentos de demostración en secuencias de tácticas y usar la elaboración de Lean para marcar pasos válidos y primeros fallos, el sistema genera señales de recompensa densas basadas en teoría de tipos. Los experimentos demuestran que la supervisión a nivel de táctica supera a los métodos solo de resultado en benchmarks como MiniF2F y ProofNet, destacando el papel de Lean tanto como evaluador como fuente de recompensa de entrenamiento.