OpenAI는 높은 추론 능력과 Python 도구 접근성을 갖춘 자체 o3-mini 모델이 FrontierMath 벤치마크에서 32%의 점수를 달성했다고 주장합니다. 그러나 Epoch의 공식 독립 평가에서는 훨씬 낮은 11%의 점수가 보고되었습니다.
- Epoch은 이 벤치마크를 구축했으며 정확한 채점을 위한 더 나은 인센티브를 가지고 있습니다.
- OpenAI는 가장 어려운 문제 계층에서 28%의 점수를 보고했는데, 이는 전체 점수와 의심스럽게 가깝습니다.
- Epoch은 테스트 인프라 및 데이터에 대한 광범위한 정보를 게시한 반면, OpenAI는 거의 게시하지 않았습니다.
- 차이점은 OpenAI가 더 강력한 내부 스캐폴드, 더 많은 테스트 시간 컴퓨팅 또는 다른 문제 하위 집합(180개 대 290개)을 사용했기 때문일 수 있습니다.
결과 차이는 대규모 언어 모델 벤치마킹에서 투명한 평가 방법론과 독립적인 검증의 중요성을 강조합니다.