研究者たちは、言語ガイド付きの自律エージェントを構築およびテストするために設計された、非常にリアルで再現性の高い環境であるWebArenaを導入しました。以前の合成設定とは異なり、このプラットフォームは4つの一般的なドメイン(電子商取引、ソーシャルフォーラム、共同ソフトウェア開発、コンテンツ管理)にわたって完全に機能するウェブサイトを提供しています。
- 環境には、人間のようなタスク解決を促進するためのマップや外部知識ベースなどのツールが含まれています。
- エージェントの完了の機能的正しさを評価するために、多様で長期のタスクのベンチマークがリリースされました。
- ベースライン実験では、最良のGPT-4ベースのエージェントがエンドツーエンドのタスク成功率14.41%しか達成できないことが示されています。
- このパフォーマンスは人間の78.24%というパフォーマンスと比較して著しく低いものです。
結果は、現在の最先端の大規模言語モデルが現実のタスクにおいて完璧から遠く離れていることを強調し、WebArenaが将来の進歩を測定するための有用性を示しています。