벤치마크 · agentic

WebArena

9 결과 9 모델

WebArena는 자율 web 에이전트가 현실적인 자체 호스팅 웹사이트 모음(온라인 쇼핑, 포럼, 콘텐츠 관리 시스템(CMS) 등)에서 실제 다단계 작업을 완수할 수 있는지 평가합니다. 지표는 task success rate(작업 성공률)로, 에이전트가 올바르게 완료한 작업의 비율입니다.

자세히 보기
예시
대표적인 작업 예: 「어떤 카테고리에서 가장 저렴한 상품을 찾아 두 개를 장바구니에 담기」로, 에이전트는 실제 사이트에서 탐색·클릭·입력을 하며 목표를 달성해야 합니다.
채점 방식
지표는 작업 성공률로, 완료한 작업 수를 전체 작업 수로 나눈 값을 백분율로 나타냅니다.
검증 방식
각 작업에는 프로그램 검증기가 딸려 있어 기대한 답과 일치하는지, 또는 웹사이트의 최종 상태를 검사하는 방식으로 결과를 자동 검증하므로, 채점은 사람이 아니라 기계가 합니다.
왜 중요한가
LLM 에이전트가 실제 웹사이트를 처음부터 끝까지 정말로 다룰 수 있는지를 측정하며, 단일 단계나 합성된 web 작업보다 더 어렵고 실용적이어서 에이전트형 web 자동화의 핵심 잣대가 됩니다.
예제 풀이
문제
당신은 WebArena의 자체 호스팅 GitLab 환경에서 동작하는 자율 웹 에이전트입니다. 페이지의 accessibility tree를 관찰하고 매 단계마다 WebArena 액션 공간에서 하나의 액션을 출력합니다(예: click [id], type [id] [text] [enter], goto [url], stop [answer]). 목표: a11yproject/a11yproject.com 저장소에 Bug: login button unresponsive 제목의 새 issue를 만들고 자신에게 할당하세요.
해답
goto [http://gitlab.webarena/a11yproject/a11yproject.com/-/issues/new]
type [1023] [Bug: login button unresponsive] [0]
click [1187]        # open the Assignee dropdown
click [1203]        # choose "Assign to me"
click [1250]        # click the "Create issue" button
stop [N/A]
풀이
이 궤적은 새 issue 폼을 열고 정확한 제목을 입력한 뒤 담당자 메뉴로 자신에게 할당하고 제출합니다. 작업이 값을 반환하는 대신 상태를 변경하므로 stop [N/A]로 에피소드를 종료합니다. WebArena의 program_html 평가기는 생성된 issue를 다시 불러와 DOM을 기능적으로 검사합니다(제목이 주어진 문자열과 같고 담당자가 로그인한 사용자와 같은지). 따라서 거의 맞은 결과도 0점을 받습니다.
0 19.5 39 58.5 78 2023-07-25 2025-01-26 2026-07-31 GPT-4-based agent · 14.4 · 2023-07-25 SteP · 33.5 · 2023-10-05 AWA 1.5 · 57.1 · 2024-08-08 AgentOccam · 9.8 · 2024-10-17 CUA · 58.1 · 2025-01-23 Surfer 2 · 69.6 · 2025-10-22 ColorBrowserAgent · 71.2 · 2026-01-12 GUI-Owl-1.5 · 48.4 · 2026-02-24 Qwen-UI-Agent · 73.6 · 2026-07-31
GPT-4-based agent SteP AWA 1.5 AgentOccam CUA Surfer 2 ColorBrowserAgent GUI-Owl-1.5 Qwen-UI-Agent
타임라인
날짜 모델 점수 출처
2026-07-31 Qwen-UI-Agent 73.6% Qwen-UI-Agent가 모바일 사용 벤치마크에서 최첨단 성능을 달성하다
2026-02-24 GUI-Owl-1.5 48.4% GUI-Owl-1.5가 멀티 플랫폼 기본 GUI 에이전트를 도입
2026-01-12 ColorBrowserAgent 71.2% ColorBrowserAgent, 강력한 장기간 웹 자동화를 위한 적응형 지식 진화 도입
2025-10-22 Surfer 2 69.6% Surfer 2, 시각적 관찰을 통한 크로스플랫폼 컴퓨터 사용에서 최첨단 달성
2025-01-23 CUA 58.1% OpenAI, 컴퓨터 사용 에이전트(CUA) 기반 Operator 연구 미리보기를 소개
2024-10-17 AgentOccam 9.8% AgentOccam은 관찰 및 행동 공간을 정렬하여 LLM 웹 에이전트 성능을 향상시킵니다
2024-08-08 AWA 1.5 57.14% AWA 1.5, WebArena 벤치마크에서 57.14% 달성
2023-10-05 SteP 33.5% SteP은 웹 작업 성능 개선을 위해 적층된 LLM 정책을 사용
2023-07-25 GPT-4-based agent 14.41% WebArena: 자율 에이전트를 위한 현실적인 웹 환경