ChatGPT, Claude 및 Gemini에 대한 감사 결과, API 평가 지표가 배포된 채팅봇 인터페이스로 신뢰할 수 있게 전달되지 않는다는 것이 밝혀졌습니다. 이 연구는 API 기반 측정이 실제 사용과 체계적으로 다르다는 "문맥 유효성 격차"를 식별합니다.
- API 평가는 인터페이스 평가보다 정확도에서 3.4퍼센트포인트 높은 점수를 받습니다.
- 테스트-재테스트 일치도는 인터페이스 접근에 비해 API 접근에서 2.1퍼센트포인트 더 높습니다.
- ChatGPT의 경우, 인터페이스로 전환함으로써 발생하는 성능 저하는 GPT 5.3과 GPT 5.4 사이의 차이보다 큽니다.
- API 컨트롤을 통해 시스템 프롬프트, 샘플링 매개변수 및 추론 설정을 조정해도 이 성능 격차를 신뢰할 수 있게 제거하지 못합니다.
이러한 발견은 배포된 시스템의 대리자로 API 평가를 사용하는 것을 복잡하게 만들며, 벤치마크 점수가 실제 사용자 지향 능력을 과대평가할 수 있음을 나타냅니다.