벤치마크 · agentic
AgentBench
AgentBench는 코드·게임·웹에 걸친 8개의 서로 다른 환경에서 LLM을 대화형 에이전트로 평가하며 다중 턴 의사결정을 측정한다. 각 환경이 고유한 점수를 내고, 이를 가중 평균한 단일 Overall Score로 합산한다.
자세히 보기
- 예시
- 「운영체제」 환경 과제: 에이전트에게 자연어 목표(예: 조건에 맞는 파일 수 세기, 파일 권한 변경)가 주어지고, 라운드마다 bash 명령을 입력해 각 출력을 읽은 뒤 최종 답을 제출하거나 shell을 요구된 상태로 남긴다.
- 채점 방식
- 각 환경은 고유한 지표를 사용한다 — 성공률(OS, DB, House-Holding), F1(지식 그래프), 평균 보상(Web Shopping), 단계/요소 정확도(웹 브라우징), 게임 진행도/보상(카드 게임, 퍼즐). 대표 지표인 Overall Score는 8개 환경 점수의 가중 평균이며, 난이도를 균형 있게 맞춰 쉬운 과제 하나가 지배하지 않도록 가중치를 정한다.
- 검증 방식
- 모든 과제는 실행 가능한 환경에서 돌아가며 자동·결정론적 채점기로 판정된다. 에이전트의 다중 턴 궤적은 프로그램으로 검증된다(예: shell 확인 스크립트, 데이터베이스 최종 상태, WebShop 보상, 정답 행동과의 일치). 사람 심사는 없으며, 상호작용에는 최대 라운드 수가 있고 한도 초과나 잘못된 행동은 실패로 간주된다.
- 왜 중요한가
- LLM을 단일 턴 응답자가 아니라 에이전트로 평가한 최초의 표준 벤치마크 중 하나로, 장기 추론·도구 사용·오류 복구를 시험한다. 실제 에이전트 과제에서 최상위 상용 API 모델과 오픈소스 모델 사이의 큰 격차를 드러냈다.
예제 풀이
문제
「운영체제」 환경. Ubuntu의 bash shell에서 에이전트에게 다음과 같이 지시한다: 「이 시스템에서 로그인 shell이 /bin/bash인 사용자 계정은 몇 개입니까? 숫자로 답하세요.」 답하기 전에 여러 라운드에 걸쳐 shell 명령을 몇 개 실행할 수 있다.
해답
grep -c ':/bin/bash$' /etc/passwd
풀이
/etc/passwd 각 줄의 콜론으로 구분된 7번째 필드가 로그인 shell이므로, :/bin/bash로 끝나는 줄을 세면 bash 로그인 계정 수가 나온다. 에이전트는 명령 출력에서 이 수를 읽어 환경의
answer(N) 행동으로 반환한다. 채점: OS 채점기가 검증 스크립트를 실행해 제출을 이진 성공/실패로 채점한다.이 벤치마크에 대해 아직 검증된 점수가 없습니다.