OpenAI는 2025년 1월 말 공개 출시를 앞두고 AI 능력의 빠른 진전을 시사하며 새로운 o3 추론 언어 모델을 미리 선보였습니다. 이 발표는 Gemini 1.5 Pro 및 Claude 3.5 Sonnet과 같은 이전 최첨단 모델 대비 상당한 성능 도약을 강조합니다.

  • o3는 인간의 유동적 지능을 측정하도록 설계된 벤치마크인 ARC AGI 상 공개 세트에서 85% 임계치를 초과한 최초의 모델입니다.
  • Frontier Math 벤치마크에서 25%의 점수를 달성했으며, 이는 이전 최첨단 기록인 2%에서 상당한 증가폭입니다.
  • 이 모델은 Codeforces에서 국제 그랜드마스터 수준의 성능을 달성하고 SWE-Bench-Verified에서 71.7% 점수로 새로운 최첨단 기록을 세웠습니다.
  • OpenAI는 또한 숙고형 정렬에 관한 연구를 공개하여 o1-class 모델이 안전성 및 정렬 연구에 어떻게 기여할 수 있는지 보여주었습니다.

이러한 결과는 추론 모델이 수학 및 코딩과 같은 검증 가능한 도메인을 넘어 가치를 제공하기 시작했으며, 이는 AI 연구 생태계 전반의 진전을 가속화할 잠재력을 가지고 있음을 시사합니다.