연구자들은 모델의 사전 학습 데이터와 더 잘 정렬되도록 관찰 및 행동 공간을 정제하여 성능을 개선하는 LLM 기반 웹 에이전트를 위한 기준선인 AgentOccam을 소개합니다. 이 접근 방식은 인컨텍스트 예제나 멀티 에이전트 시스템과 같은 수작업 전략의 필요성을 제거합니다.
- WebArena 벤치마크에서 AgentOccam은 이전 state-of-the-art 방법보다 절대값으로 9.8포인트(+29.4%) 앞서며, 동시 연구보다 5.9포인트(+15.8%) 앞섭니다.
- 이 방법은 유사한 일반 웹 에이전트 대비 성공률을 26.6포인트(+161%) 향상시킵니다.
- 이 설계는 온라인 피드백이나 검색 전략을 사용하지 않고 웹 작업에서 LLM의 zero-shot 성능을 강조합니다.
이 연구는 현실 세계 시나리오에서 일반화하기 위해 LLM 기반 에이전트의 관찰 및 행동 공간을 신중하게 조정하는 것이 얼마나 중요한지 강조합니다.