Uma equipe da Google Cloud AI Research, da Washington University em St. Louis e da UNC Chapel Hill lançou o EnvHarness, uma camada programável que transforma benchmarks de agentes estáticos em mundos de treinamento adaptativos. O sistema envolve ambientes existentes usando componentes plug-in que operam estritamente por meio da interface padrão reset() e step(), permitindo que o ambiente se adapte ao treinamento da política sem alterar o simulador subjacente ou os verificadores construídos por humanos.

  • O EnvHarness usa um designer de LLM chamado EnvRigger para diagnosticar falhas nos rollouts de uma política e escrever automaticamente wrappers direcionados.
  • O sistema inclui três componentes composáveis: Stage (reescreve estados iniciais), Contract (instala hooks por etapa em ações e observações) e Chain (compõe segundos ambientes sob orçamentos compartilhados).
  • Em cinco benchmarks, incluindo ALFWorld, WebArena, SWE-bench Verified, OfficeQA e SpreadsheetBench, habilidades extraídas via EnvHarness ganham até 9,0 pontos em tarefas não vistas.
  • No SWE-bench Verified, a abordagem reduz os passos médios de execução em 9,8% enquanto aumenta as taxas de resolução de 49,88 para 52,58.
  • O código está disponível como Python com licença Apache-2.0, exigindo apenas um ambiente resetável e um loop existente de avaliação de agentes.

Os autores consideram isso importante porque ambientes estáticos param de ensinar uma vez resolvidos, enquanto o EnvHarness permite que os agentes continuem aprendendo ao direcionar fraquezas específicas identificadas durante o treinamento.