Команда исследователей Google Cloud AI Research, Вашингтонского университета в Сент-Луисе и Университета Северной Каролины в Чапел-Хилл выпустила EnvHarness — программируемый слой, преобразующий статические бенчмарки для агентов в адаптивные обучающие среды. Система оборачивает существующие среды с помощью компонентов плагинов, которые работают строго через стандартный интерфейс reset() и step(), позволяя среде адаптироваться к обучению политики без изменения базового симулятора или созданных человеком верификаторов.

  • EnvHarness использует LLM-дизайнер под названием EnvRigger для диагностики недостатков в rollout'ах политики и автоматического написания целевых оберток.
  • Система включает три композируемых компонента: Stage (переписывает начальные состояния), Contract (устанавливает хуки на каждом шаге для действий и наблюдений) и Chain (композирует вторичные среды при общих бюджетах).
  • На пяти бенчмарках, включая ALFWorld, WebArena, SWE-bench Verified, OfficeQA и SpreadsheetBench, навыки, извлеченные с помощью EnvHarness, улучшают результаты на отложенных задачах до 9.0 баллов.
  • На SWE-bench Verified подход сокращает среднее количество шагов выполнения на 9.8%, увеличивая скорость разрешения задач с 49.88 до 52.58.
  • Код доступен под лицензией Apache-2.0 в виде Python-библиотеки, требующей только среду с возможностью сброса и существующий цикл оценки агента.

Авторы считают это важным, потому что статические среды перестают обучать после решения задачи, тогда как EnvHarness позволяет агентам продолжать обучение, фокусируясь на конкретных слабых местах, выявленных во время обучения.