Google Cloud AI Research、ワシントン大学セントルイス校、ノースカロライナ大学チャペルヒル校のチームは、静的なエージェントベンチマークを適応的なトレーニング世界に変換するプログラム可能なレイヤーであるEnvHarnessをリリースしました。このシステムは、プラグインコンポーネントを使用して既存の環境をラップし、標準のreset()およびstep()インターフェースを通じてのみ動作させることで、基盤となるシミュレータや人間が構築した検証子を改変することなく、環境がポリシーのトレーニングに適応できるようにしています。
- EnvHarnessはEnvRiggerと呼ばれるLLMデザイナーを使用して、ポリシーのロールアウトにおける欠陥を診断し、ターゲットを絞ったラッパーを自動的に記述します。
- システムには3つの合成可能なコンポーネントが含まれています:Stage(開始状態を書き換える)、Contract(アクションと観測に対してステップごとのフックをインストールする)、Chain(共有予算の下で第2の環境を合成する)。
- ALFWorld、WebArena、SWE-bench Verified、OfficeQA、SpreadsheetBenchを含む5つのベンチマークにおいて、EnvHarnessを通じて抽出されたスキルは、ホールドアウトタスクで最大9.0ポイント向上しました。
- SWE-bench Verifiedでは、このアプローチにより平均実行ステップ数が9.8%減少し、解決率が49.88から52.58に増加しました。
- コードはApache-2.0 Pythonとして公開されており、リセット可能な環境と既存のエージェント評価ループのみが必要です。
著者たちは、静的な環境は解決されるとそれ以上教えるのをやめてしまうのに対し、EnvHarnessはトレーニング中に特定された特定の弱点をターゲットにすることでエージェントが継続的に学習できるようにするため、これを重要視しています。