OpenAI는 새로운 o3 모델을 발표했으며, 이 모델은 생성형 AI의 기존 평균 2%에서 크게 도약한 Frontier Math 벤치마크에서 25%의 점수를 기록했습니다. 이 결과는 AI의 수학적 추론 능력의 빠른 개선을 강조합니다.
- Frontier Math는 암기된 데이터에 의존하지 않고 인간과 유사한 능력을 테스트하도록 설계된 도전적인 수학 문제들의 비공개 벤치마크입니다.
- o3 모델은 반복적 사고 사슬을 사용하여 답변하기 전에 자신의 추론 단계를 평가하고 수정할 수 있습니다.
- 이 과정에는 상당한 연산이 필요하며, 개별 문제당 답변 비용이 1000달러를 초과하기도 합니다.
- Google DeepMind의 AlphaProof와 같은 전용 모델과 달리 o3는 고급 수학 기술을 보여주는 범용 AI입니다.
기사는 비용이 감소하고 점수가 향상된다면 AI 수학자가 현재 인간 전문가 부족으로 제한된 검증 프로세스를 자동화하여 형식적 방법을 변화시킬 수 있다고 제안합니다.