RODS aborda el agotamiento de muestras en RL de uso de herramientas multi-turno utilizando la varianza de la recompensa para detectar límites de capacidad. Sintetiza nuevos datos en tiempo real, coincidiendo con la complejidad estructural de las muestras límite, y mantiene un búfer de repetición dinámico que coevoluciona con la política. RODS logra un rendimiento comparable a una tubería offline de 17K muestras con 20x menos trayectorias.
RODS: Síntesis de datos en línea impulsada por recompensa para agentes de uso de herramientas multi-turno
Control jerárquico basado en LLM en juegos multiagente
Un sistema jerárquico que utiliza un LLM preentrenado para seleccionar políticas de habilidades de RL supera al RL plano en un entorno King of the Hill 2v2. Igualua el rendimiento de los árboles de comportamiento diseñados a mano en tasa de victoria y es percibido como más humano por el 60% de los usuarios, destacando una coordinación efectiva y adaptabilidad sin diseño manual de reglas.
GraphPO: Optimización de políticas basada en grafos para modelos de razonamiento
GraphPO introduce un marco de grafos acíclicos dirigidos para representar rollouts de razonamiento, fusionando caminos semánticamente equivalentes para reducir la exploración redundante. Asigna ventajas de eficiencia y corrección a las aristas, mejorando la eficiencia de inferencia y la supervisión del proceso mientras reduce la varianza de estimación de ventaja. Los experimentos muestran que GraphPO supera a los métodos basados en cadenas y árboles en tres LLMs en tareas de razonamiento y búsqueda agéntica bajo presupuestos idénticos de tokens o respuestas.
Generalización composicional en el razonamiento de modelos de lenguaje
Un modelo de selección latente jerárquico muestra que el ajuste fino supervisado y el aprendizaje por refuerzo trabajan juntos para habilitar la generalización composicional en modelos de lenguaje. El SFT proporciona materiales de módulos crudos, mientras que el RL identifica y recombina módulos atómicos a partir de trazas compuestas para resolver nuevos problemas. Entrenar en trazas compuestas conduce a una generalización más fuerte que el entrenamiento de módulos aislados, y se encuentra un protocolo efectivo donde el SFT asegura la cobertura de módulos y el RL impulsa la exploración de composiciones novedosas.
d-OPSD: Auto-distilación en política para LLMs de difusión
d-OPSD es el primer marco de auto-distilación en política diseñado para LLMs de difusión. Utiliza respuestas auto-generadas como condicionamiento de sufijo y supervisión a nivel de paso, permitiendo un post-entrenamiento eficiente con solo aproximadamente el 10% de los pasos de optimización de RLVR, superando a las líneas base de RLVR y SFT en cuatro benchmarks de razonamiento.
PACT: Deliberación de Modelos de Lenguaje Pequeños para Aprendizaje por Refuerzo Reactivo
PACT combina una política de RL reactiva con un Modelo de Lenguaje Pequeño (SLM) de 2B parámetros para generar y validar planes de acción. El plan SLM se ejecuta directamente si se verifica como seguro, factible y completo, omitiendo la política de RL. PACT supera a las líneas base en tres entornos FrozenLake de dificultad creciente.