연구자들은 언어 기반 자율 에이전트를 구축하고 테스트하기 위해 설계된 매우 현실적이고 재현 가능한 환경인 WebArena를 소개했습니다. 이전의 합성 설정과는 달리, 이 플랫폼은 전자 상거래, 소셜 포럼, 협업 소프트웨어 개발 및 콘텐츠 관리라는 네 가지 일반적인 도메인에 걸쳐 완전히 기능적인 웹사이트를 제공합니다.
- 환경에는 인간과 유사한 작업 해결을 장려하기 위한 지도와 외부 지식베이스와 같은 도구가 포함되어 있습니다.
- 에이전트 완료의 기능적 정확성을 평가하기 위해 다양하고 장기적인 작업의 벤치마크가 출시되었습니다.
- 베이스라인 실험 결과, 최상의 GPT-4 기반 에이전트는 엔드투엔드 작업 성공률 14.41%만 달성했습니다.
- 이 성능은 인간 성능인 78.24%보다 현저히 낮습니다.
이 결과는 현재 최첨단 대규모 언어 모델이 실제 작업에서 완벽하지 않음을 강조하며, WebArena가 미래의 진전을 측정하는 데 유용함을 보여줍니다.