OpenAI는 최종 답변을 제공하기 전에 추론 토큰을 생성하고 정제하여 추론을 모방하도록 훈련된 o1-preview 및 o1-mini 모델을 출시했습니다. ARC-AGI 공개 평가 데이터셋에서의 테스트 결과, 두 가지 o1 변형 모델 모두 정확도 측면에서 GPT-4o보다 우수한 성능을 보였습니다.

  • o1-preview는 Anthropic의 Claude 3.5 Sonnet과 유사한 정확도를 달성하지만 작업을 완료하는 데 약 10배 더 오래 걸립니다.
  • 공개된 ARC-AGI 400개 문제를 해결하는 데 o1은 70시간이 소요된 반면, GPT-4o와 Claude 3.5 Sonnet은 단 30분이었습니다.
  • 이 모델들은 훈련 및 추론 시간 모두에 적용된 사고의 사슬(Chain-of-Thought) 패러다임을 활용하며, 강화학습을 통해 전략을 정제합니다.
  • 성능은 테스트 시간 컴퓨팅과 함께 확장되며, 정확도와 사용된 추론 토큰의 양 사이에는 로그 선형 관계가 나타납니다.

이 결과는 증가된 테스트 시간 컴퓨팅이 정확도를 향상시키지만, 실제 적용 및 벤치마킹을 위해 효율성이 여전히 중요한 요소임을 강조합니다.