ベンチマーク · agentic

WebArena

9 結果 9 モデル

WebArena は、自律的な web エージェントが、現実的な自己ホスト型ウェブサイト群(オンラインショッピング、フォーラム、コンテンツ管理システム(CMS)など)で実際の複数ステップのタスクを完了できるかを評価します。指標は task success rate(タスク成功率)で、エージェントが正しく完了したタスクの割合です。

詳しく見る
代表的なタスク例:「あるカテゴリーで最も安い商品を見つけ、それを2つカートに入れる」。エージェントは実際のサイト上で閲覧・クリック・入力を行って目標を達成しなければなりません。
採点方法
指標はタスク成功率で、完了したタスク数を全タスク数で割った値をパーセンテージで表します。
検証方法
各タスクにはプログラムによるチェッカーが付属し、期待される答えとの一致か、ウェブサイトの最終状態の検査によって結果を自動で検証します。そのため採点は人手ではなく機械が行います。
重要な理由
LLM エージェントが実際のウェブサイトをエンドツーエンドで本当に操作できるかを測るもので、単一ステップや合成的な web タスクより難しく実践的なため、エージェント型 web 自動化の重要な指標となっています。
解説付きの例
課題
あなたは WebArena のセルフホスト型 GitLab 環境で動く自律型ウェブエージェントです。ページの accessibility tree を観測し、各ステップで WebArena のアクション空間から 1 つのアクションを出力します(例:click [id]type [id] [text] [enter]goto [url]stop [answer])。目標:a11yproject/a11yproject.com リポジトリに Bug: login button unresponsive というタイトルの新しい issue を作成し、自分自身に割り当ててください。
解答
goto [http://gitlab.webarena/a11yproject/a11yproject.com/-/issues/new]
type [1023] [Bug: login button unresponsive] [0]
click [1187]        # open the Assignee dropdown
click [1203]        # choose "Assign to me"
click [1250]        # click the "Create issue" button
stop [N/A]
解説
この軌跡は新規 issue フォームを開き、正確なタイトルを入力し、担当者メニューから自分に割り当てて送信します。タスクは値を返すのではなく状態を変更するため、stop [N/A] でエピソードを終了します。WebArena の program_html 評価器は作成された issue を再読み込みし、DOM を機能的に検査します(タイトルが指定文字列と一致し、担当者がログイン中のユーザーと一致するか)。したがって、惜しいだけの結果は 0 点になります。
0 19.5 39 58.5 78 2023-07-25 2025-01-26 2026-07-31 GPT-4-based agent · 14.4 · 2023-07-25 SteP · 33.5 · 2023-10-05 AWA 1.5 · 57.1 · 2024-08-08 AgentOccam · 9.8 · 2024-10-17 CUA · 58.1 · 2025-01-23 Surfer 2 · 69.6 · 2025-10-22 ColorBrowserAgent · 71.2 · 2026-01-12 GUI-Owl-1.5 · 48.4 · 2026-02-24 Qwen-UI-Agent · 73.6 · 2026-07-31
GPT-4-based agent SteP AWA 1.5 AgentOccam CUA Surfer 2 ColorBrowserAgent GUI-Owl-1.5 Qwen-UI-Agent
タイムライン
日付 モデル スコア ソース
2026-07-31 Qwen-UI-Agent 73.6% Qwen-UI-Agentがモバイルユースベンチマークで最良の成果を達成
2026-02-24 GUI-Owl-1.5 48.4% GUI-Owl-1.5がマルチプラットフォームの基盤GUIエージェントを導入
2026-01-12 ColorBrowserAgent 71.2% ColorBrowserAgentが堅牢な長時間ホライズンWeb自動化のための適応的知识進化を導入
2025-10-22 Surfer 2 69.6% Surfer 2が視覚的観察を通じてクロスプラットフォームのコンピュータ操作で最先端を達成
2025-01-23 CUA 58.1% OpenAIがComputer-Using Agent (CUA)を活用したOperatorの研究プレビューを発表
2024-10-17 AgentOccam 9.8% AgentOccamは観測と行動空間をアライメントし、LLM Webエージェントのパフォーマンスを向上
2024-08-08 AWA 1.5 57.14% AWA 1.5 が WebArena ベンチマークで 57.14% を達成
2023-10-05 SteP 33.5% StePはスタックされたLLMポリシーを使用してウェブタスクのパフォーマンスを向上させる
2023-07-25 GPT-4-based agent 14.41% WebArena:自律エージェントのための現実的なWeb環境