Este artículo presenta una taxonomía unificada de origen causal que clasifica los desplazamientos distribucionales en el aprendizaje por refuerzo en fuentes internas, impulsadas por el agente, y externas, impulsadas por el entorno. Unifica la generalización ID/OOD y los entornos no estacionarios al encuadrar los desplazamientos como cambios estructurados en el proceso de interacción agente-entorno, utilizando una descomposición POMDP y una perspectiva de frontera de tiempo desplazado.
Taxonomía causal-unificada de origen para desplazamientos distribucionales en RL
HABC mejora el ajuste fino de RL en VLA con resultados dispersos
El Clonamiento de Comportamiento Jerárquico Ponderado por Ventaja (HABC) mejora el ajuste fino de RL en línea para agentes de visión y lenguaje mediante el uso de cabezales de crítico separados para viabilidad y eficiencia. Combina sus salidas a través de una puerta adaptativa al estado y aplica pesos por transición, mientras que la asignación de crédito consciente de intervenciones evita la fuga de supervisión. En experimentos con robots reales, HABC aumenta las tasas de éxito hasta 92%, 88% y 38% en tres tareas bimanuales, superando los lineamientos base de SFT de 36%, 44% y 12%.
Marco de Auto-Distilación Condicionada por Rúbrica
La Auto-Distilación Condicionada por Rúbrica introduce un marco que utiliza rúbricas estructuradas para proporcionar retroalimentación a nivel de token y de alta granularidad durante la auto-distilación de modelos de lenguaje de razonamiento. Al condicionar los modelos maestro en criterios a nivel de rúbrica, permite una asignación de crédito más precisa que las recompensas escalares, superando a GRPO y OPSD por 1.0 y 0.9 puntos en promedio en benchmarks de razonamiento científico.
Marco de Auto-Distilación Condicionada por Rúbrica
La Auto-Distilación Condicionada por Rúbrica introduce un marco que utiliza rúbricas estructuradas para proporcionar retroalimentación a nivel de token y de alta granularidad durante la auto-distilación de modelos de lenguaje de razonamiento. Al condicionar los modelos maestros en criterios a nivel de rúbrica, permite una asignación de crédito más precisa que las recompensas escalares, superando a GRPO y OPSD en 1.0 y 0.9 puntos, respectivamente, en promedio en benchmarks de razonamiento científico.
UFP4: El entrenamiento uniforme de 4 bits supera el sesgo de contracción en el preentrenamiento de LLM
Un estudio identifica un sesgo de contracción en los formatos FP4 basados en E2M1 debido a la asimetría geométrica, lo que provoca acumulación de errores multiplicativos e inestabilidad en el entrenamiento. La receta UFP4 propuesta utiliza cuadrículas uniformes E1M2/INT4 y aplica la Transformada de Hadamard Aleatoria a todos los GEMM, logrando una degradación menor de la pérdida que las líneas base E2M1 en el preentrenamiento de LLM a gran escala. Los autores recomiendan E1M2/INT4 como un primitivo de entrenamiento de primera clase para futuros aceleradores.
H-RePlan: Recuperación jerárquica para sistemas de agentes multi-dispositivo
H-RePlan introduce un marco de replanificación jerárquica que separa la recuperación de estrategias locales del dispositivo de la replanificación global del orquestador. Supera a las líneas base existentes al lograr una mayor tasa de finalización y adherencia a las instrucciones, con menor costo en tokens, mediante una recuperación consciente del alcance en sistemas de agentes multi-dispositivo.