EnvRL introduce un marco que mejora el aprendizaje por refuerzo agéntico incorporando la dinámica del entorno a través de objetivos de predicción de estado y dinámica inversa. Al entrenarse con GRPO, EnvRL mejora las tasas de éxito de Qwen-2.5-1.5B-Instruct de 72.8% a 77.4% en ALFWorld y de 56.8% a 67.0% en WebShop.
EnvRL: Aprovechando la Dinámica del Entorno en RL Agéntico
EnvRL: Aprovechando la dinámica del entorno en RL agéntico
EnvRL introduce un marco que mejora el aprendizaje por refuerzo agéntico incorporando la dinámica del entorno a través de objetivos de predicción de estado y dinámicas inversas. Logra ganancias significativas en las tasas de éxito en benchmarks de largo horizonte, mejorando el rendimiento de Qwen-2.5-1.5B-Instruct de 72.8% a 77.4% en ALFWorld y de 56.8% a 67.0% en WebShop cuando se entrena con GRPO.
Entorno de entrenamiento diseñado por LLM para RL con razonamiento multiagente
El marco LLM-as-Environment-Engineer utiliza LLMs para rediseñar automáticamente entornos de entrenamiento en aprendizaje por refuerzo analizando trayectorias de fallo y datos contextuales. En el banco de pruebas MAPF-FrozenLake, supera a LLMs propietarios más grandes y a las líneas base de entornos fijos, con Qwen3-4B logrando el mejor rendimiento agregado. El análisis muestra que la evidencia de fallo y las configuraciones de trabajo preservadas son clave, y la checkpoint actual de RL funciona mejor que el modelo base como ingeniero de entornos.
VHD-Play genera entornos de RL agéntico a partir de mecanismos resueltos
VHD-Play es una tubería que genera diversos entornos de aprendizaje por refuerzo agéntico muestreando y resolviendo modelos matemáticos antes de renderizar sus procesos de decisión como herramientas con estado. Este enfoque asegura que la dinámica ejecutable y las referencias de puntuación de trayectorias se hereden directamente del modelo resuelto, abordando los problemas de desalineación comunes en las tuberías de generación existentes.
SkillGym internaliza habilidades humanas en LLMs para la resolución de problemas del mundo real
Los investigadores presentan SkillGym, un marco que transforma las habilidades de agentes escritas por humanos en entornos de entrenamiento ejecutables y verificables para agentes de modelos de lenguaje grandes. El sistema utiliza una canalización de habilidad a tarea para instanciar tareas concretas y verificar resultados con verificadores basados en código.
ExecCritic utiliza RL específico por rol para mejorar agentes de codificación mediante reparación guiada por pruebas
Los investigadores presentan ExecCritic, un marco que combina una estructura de verificar-revisar-corregir con aprendizaje por refuerzo específico por rol para potenciar agentes de codificación. El sistema separa la construcción de pruebas de la reparación del código fuente, utilizando un agente de Pruebas para generar pruebas nativas del repositorio y un agente de Reparación para revisar el código basándose en retroalimentación de ejecución.