Une équipe de Google Cloud AI Research, de la Washington University in St. Louis et de l'UNC Chapel Hill a publié EnvHarness, une couche programmable qui transforme les benchmarks d'agents statiques en mondes d'entraînement adaptatifs. Le système enveloppe les environnements existants à l'aide de composants plug-in qui opèrent strictement via l'interface standard reset() et step(), permettant à l'environnement de s'adapter à l'entraînement de la politique sans modifier le simulateur sous-jacent ni les vérificateurs construits par les humains.
- EnvHarness utilise un concepteur LLM appelé EnvRigger pour diagnostiquer les défauts des rollouts d'une politique et écrire automatiquement des wrappers ciblés.
- Le système comprend trois composants composables : Stage (réécrit les états initiaux), Contract (installe des hooks par étape sur les actions et les observations) et Chain (compose de nouveaux environnements sous des budgets partagés).
- Sur cinq benchmarks incluant ALFWorld, WebArena, SWE-bench Verified, OfficeQA et SpreadsheetBench, les compétences extraites via EnvHarness gagnent jusqu'à 9,0 points sur les tâches non vues.
- Sur SWE-bench Verified, l'approche réduit le nombre moyen d'étapes d'exécution de 9,8 % tout en augmentant les taux de résolution de 49,88 à 52,58.
- Le code est disponible sous licence Apache-2.0 en Python, nécessitant uniquement un environnement réinitialisable et une boucle d'évaluation d'agent existante.
Les auteurs considèrent cela comme important car les environnements statiques cessent d'apprendre une fois résolus, tandis qu'EnvHarness permet aux agents de continuer à apprendre en ciblant les faiblesses spécifiques identifiées pendant l'entraînement.