마이크로소프트와 허깅페이스는 AI 에이전트의 도구 호출이나 최종 응답뿐만 아니라 격리된 데이터베이스 상태에 미치는 영향을 평가하는 벤치마크인 ThinkingBox를 출시했습니다. 다양한 LLM 모델에 대해 각각 20회씩 실행된 507개의 상태 유지 비즈니스 워크플로우에 걸쳐 연구한 결과, 많은 에이전트가 유효한 도구 호출을 생성하지만 백엔드에 잘못된 값, 의도하지 않은 추가 효과 또는 누락된 필수 효과를 자주 남기는 것으로 나타났습니다.
- Claude Opus 5.5는 전체적으로 67.16%의 pass@1 점수로 선두를 차지하고 있지만, 20회 반복 동안 단일 시도 점수의 대부분을 유지하는 모델은 세 개뿐입니다: GPT-6 Astra (78%), Claude Opus 5.5 (71%), 그리고 Claude Opus 5 (71%).
- Kimi-K3는 가장 넓은 작업 범위를 해결합니다(최소 한 번 성공률 93.89%)지만 일관성이 가장 낮은 편에 속하며, 20회 시도 모두에서 성공한 작업은 13.41%에 불과합니다.
- GPT-5.6 Sol은 성공적인 작업 시도당 최저 비용인 $0.127을 제공하며, GPT-5.4는 20회 시도 모두를 통과하는 가장 저렴한 신뢰할 수 있는 옵션으로 작업당 $6.80입니다.
- 실패의 약 4분의 1이 추론 결핍보다는 오류 복구 실패나 빈 조회와 같은 도구 처리 문제로 인해 발생합니다.
저자들은 pass@1 점수만으로는 배포 신뢰성에 충분하지 않다고 주장하며, 20/20 일관성률을 설계 입력으로 간주하고 프로덕션에서 변경 사항을 커밋하기 전에 터미널 상태를 확인할 것을 권장합니다.