Un equipo de Google Cloud AI Research, la Universidad de Washington en St. Louis y UNC Chapel Hill ha lanzado EnvHarness, una capa programable que transforma los benchmarks de agentes estáticos en mundos de entrenamiento adaptativos. El sistema envuelve entornos existentes mediante componentes plug-in que operan estrictamente a través de la interfaz estándar reset() y step(), permitiendo que el entorno se adapte al entrenamiento de la política sin alterar el simulador subyacente ni los verificadores construidos por humanos.
- EnvHarness utiliza un diseñador LLM llamado EnvRigger para diagnosticar defectos en las trayectorias de una política y escribir automáticamente wrappers dirigidos.
- El sistema incluye tres componentes composables: Stage (reescribe los estados iniciales), Contract (instala ganchos por paso en acciones y observaciones) y Chain (compone segundos entornos bajo presupuestos compartidos).
- En cinco benchmarks que incluyen ALFWorld, WebArena, SWE-bench Verified, OfficeQA y SpreadsheetBench, las habilidades extraídas mediante EnvHarness ganan hasta 9.0 puntos en tareas no vistas.
- En SWE-bench Verified, el enfoque reduce los pasos de ejecución promedio en un 9.8% mientras aumenta las tasas de resolución de 49.88 a 52.58.
- El código está disponible como Python con licencia Apache-2.0, requiriendo solo un entorno reiniciable y un bucle de evaluación de agentes existente.
Los autores consideran esto importante porque los entornos estáticos dejan de enseñar una vez resueltos, mientras que EnvHarness permite a los agentes continuar aprendiendo al dirigirse a debilidades específicas identificadas durante el entrenamiento.