에이전트 폐기 지수는 루프, 무작위 재시도, 과다한 도구 출력, 중단된 실행과 같은 비효율성을 식별하기 위해 11개 공개 데이터셋에서 341,054개 에이전트 궤적을 점수화했습니다. 분석 결과, 루프 및 재시도 행동은 Llama 에이전트와 같은 약한 모델에서 흔하지만 Claude 3.7 Sonnet과 Qwen3-Coder-480B에서는 드뭅니다.
- 과다한 도구 출력은 스캐폴드에 따라 크게 달라지며, OpenHands와 SWE-agent는 실행의 절반 이상에서 2만 자 이상의 관측치를 기록합니다.
- 단계 수 기준으로 가장 긴 상위 5분의 1의 실행이 추정 비용의 40%를 소비하면서도 최하위 5분의 1보다 낮은 해결률을 보입니다.
- 이 프로젝트는 허브에서 지표를 재구성하기 위한 파이프라인과 탐지기를 제공하며, 커뮤니티 검증을 위해 온라인 테이블을 제공합니다.
저자들은 데이터셋 발행자를 위한 수정 메커니즘을 제공하고 코딩 에이전트 성능의 투명성 개선을 목표로 합니다.