OpenAI는 Epoch AI가 이 관계를 공개하지 못하도록 하는 비밀유지 계약(NDA)을 체결한 상태에서 독립적인 수학 벤치마크인 FrontierMath에 자금을 제공했습니다. 이는 OpenAI가 o3 모델의 파격적인 성능을 발표한 후에야 공개될 수 있었습니다. 60명 이상의 수학자들이 개발한 이 벤치마크는 복잡한 추론 능력을 테스트하며, OpenAI의 o3는 여기서 25.2%의 성공률을 기록했습니다.
- FrontierMath는 2024년 11월에 고급 수학 문제 해결 능력을 평가하기 위해 도입되었습니다.
- Epoch AI는 o3 발표일인 12월 20일까지 OpenAI의 재정적 지원을 공개하지 않겠다는 계약을 체결했습니다.
- 벤치마크 문제는 자금 출처를 알지 못했던 60명 이상의 저명한 수학자들로 구성된 팀에 의해 제작되었습니다.
- OpenAI는 FrontierMath 데이터의 "대부분이지만 전부는 아닌" 부분에 접근할 수 있었으나, 구두 계약으로 인해 이 자료를 모델 학습에 사용하는 것이 금지되었습니다.
- Epoch AI는 투명성 부재를 실수로 인정하며, 향후 협력에서 자금 출처에 대해 더 명확한 정보를 제공할 것을 약속했습니다.
이 상황은 AI 벤치마킹의 복잡성과 특히 언어 모델의 주요 약점인 수학 추론 측면에서 투명성의 중요성을 강조합니다.