ARC Prize Foundation은 ARC-AGI 추론 벤치마크에서 OpenAI의 o3 및 o4-mini 모델에 대한 첫 번째 공개 분석을 게시했습니다. 이 평가는 이러한 최첨단 모델이 상당한 진전을 보였지만 아직 어려운 ARC-AGI-2 세트를 해결하지 못했음을 보여줍니다.
- o3-medium는 ARC-AGI-1 Semi Private Eval 세트에서 53%를 달성했으며, o4-mini-medium는 높은 효율성으로 41%에 도달했습니다.
- o3와 o4-mini 모두 더 어려운 ARC-AGI-2 벤치마크에서 3% 미만의 점수를 받았습니다.
- 높은 추론 설정은 타임아웃 또는 누락된 출력으로 인해 불완전한 커버리지를 초래하여, 이러한 결과는 리더보드 보고에 적합하지 않습니다.
- 프로덕션 o3 모델은 시각적 입력을 통합하고 다른 학습 데이터 제약을 사용함으로써 이전의 o3-preview와 다릅니다.
이 발견들은 ARC-AGI-1이 현재 모델 능력을 측정하는 민감한 도구로 남아있는 반면, ARC-AGI-2는 인간과 AI 추론 간의 격차를 해소하는 미래 모델을 위한 차세대 벤치마크 역할을 함을 강조합니다.