Epoch AI가 공개한 독립 벤치마크 결과에 따르면, OpenAI가 공개적으로 출시한 o3 모델은 FrontierMath 데이터셋에서 약 10%의 점수를 받아, 회사가 12월 발표 당시 강조했던 25% 이상의 점수에 크게 미치지 못했습니다.
- Epoch AI는 업데이트된 버전의 FrontierMath 벤치마크를 사용하여 출시된 o3 모델을 평가했으며, 약 10%의 점수를 기록했습니다.
- OpenAI의 초기 주장인 25% 이상은 공개 릴리스보다 더 강력한 내부 기반 구조에서 공격적인 테스트 타임 컴퓨팅 설정을 사용해 달성되었습니다.
- ARC Prize Foundation는 공개된 o3가 채팅 및 제품 용도로 튜닝되었으며, 그들이 테스트한 미리보기 버전보다 작은 컴퓨팅 티어를 사용한다고 확인했습니다.
- OpenAI 기술 직원은 프로덕션 모델이 최대 벤치마크 성능보다는 비용 효율성과 속도에 최적화되어 있다고 밝혔습니다.
이 차이는 제3자 벤치마크를 검증하는 중요성을 강조하며, 출시된 모델이 최고 학술 점수보다 실제 활용성을 우선시한다는 점을 명확히 합니다.