OpenAI는 추론, 코딩 및 수학 문제 해결에서 새로운 기록을 세운 차세대 추론 모델인 o3를 발표했습니다. 이 모델은 저계산 모드에서 반비공개 ARC-AGI eval에서 75.7%의 점수를, 고계산 모드에서 87.5%의 점수를 달성했습니다.
- o3는 ARC-AGI(저계산)에서 75.7%, (고계산)에서 87.5%를 기록하여 인간 수준 임계값인 85%를 초과했습니다.
- 2024년 미국 수학 올림피아드(AIME)에서 96.7%의 점수를, EpochAI의 Frontier Math Benchmark에서 25.2%의 점수를 달성했습니다.
- 코딩 분야에서 o3는 SWE-Bench Verified에서 71.7점(o1보다 22.8점 높음)을 기록했으며, Codeforces에서 Elo 등급 2,727을 받았습니다.
- 이 모델은 128K 토큰의 컨텍스트 창을 가지고 있으며 이전 버전보다 실행 비용이 훨씬 비싸다는 특징이 있습니다.