벤치마크 · agentic

AgentBench

0 결과 0 모델

AgentBench는 코드·게임·웹에 걸친 8개의 서로 다른 환경에서 LLM을 대화형 에이전트로 평가하며 다중 턴 의사결정을 측정한다. 각 환경이 고유한 점수를 내고, 이를 가중 평균한 단일 Overall Score로 합산한다.

자세히 보기
예시
「운영체제」 환경 과제: 에이전트에게 자연어 목표(예: 조건에 맞는 파일 수 세기, 파일 권한 변경)가 주어지고, 라운드마다 bash 명령을 입력해 각 출력을 읽은 뒤 최종 답을 제출하거나 shell을 요구된 상태로 남긴다.
채점 방식
각 환경은 고유한 지표를 사용한다 — 성공률(OS, DB, House-Holding), F1(지식 그래프), 평균 보상(Web Shopping), 단계/요소 정확도(웹 브라우징), 게임 진행도/보상(카드 게임, 퍼즐). 대표 지표인 Overall Score는 8개 환경 점수의 가중 평균이며, 난이도를 균형 있게 맞춰 쉬운 과제 하나가 지배하지 않도록 가중치를 정한다.
검증 방식
모든 과제는 실행 가능한 환경에서 돌아가며 자동·결정론적 채점기로 판정된다. 에이전트의 다중 턴 궤적은 프로그램으로 검증된다(예: shell 확인 스크립트, 데이터베이스 최종 상태, WebShop 보상, 정답 행동과의 일치). 사람 심사는 없으며, 상호작용에는 최대 라운드 수가 있고 한도 초과나 잘못된 행동은 실패로 간주된다.
왜 중요한가
LLM을 단일 턴 응답자가 아니라 에이전트로 평가한 최초의 표준 벤치마크 중 하나로, 장기 추론·도구 사용·오류 복구를 시험한다. 실제 에이전트 과제에서 최상위 상용 API 모델과 오픈소스 모델 사이의 큰 격차를 드러냈다.
예제 풀이
문제
「운영체제」 환경. Ubuntu의 bash shell에서 에이전트에게 다음과 같이 지시한다: 「이 시스템에서 로그인 shell이 /bin/bash인 사용자 계정은 몇 개입니까? 숫자로 답하세요.」 답하기 전에 여러 라운드에 걸쳐 shell 명령을 몇 개 실행할 수 있다.
해답
grep -c ':/bin/bash$' /etc/passwd
풀이
/etc/passwd 각 줄의 콜론으로 구분된 7번째 필드가 로그인 shell이므로, :/bin/bash로 끝나는 줄을 세면 bash 로그인 계정 수가 나온다. 에이전트는 명령 출력에서 이 수를 읽어 환경의 answer(N) 행동으로 반환한다. 채점: OS 채점기가 검증 스크립트를 실행해 제출을 이진 성공/실패로 채점한다.

이 벤치마크에 대해 아직 검증된 점수가 없습니다.