비교 분석은 수학, 코딩, 추론 벤치마크에서 Claude 3.7 Sonnet, Claude 3.5 Sonnet, OpenAI o3-mini, DeepSeek R1, Grok 3 Beta의 능력을 평가합니다.
- GPQA Diamond에서 Grok 3 Beta는 확장된 추론으로 84.6%를 달성하는 반면, Claude 3.7 Sonnet은 동일한 모드에서 84.8%를 기록합니다.
- AIME 수학 경시대회에서 Grok 3 Beta가 93.3%로 선두를 차지하는 반면, Claude 3.7 Sonnet은 61.3%의 점수를 얻었으나 Math500에서는 96.2%로 우수한 성과를 보입니다.
- OpenAI o3-mini는 비용 효율성에 중점을 두고 AIME(최대 83.3%)와 GPQA Diamond(고연산 모드에서 78%)에서 강력한 성능을 보여줍니다.
- DeepSeek R1은 AIME에서 경쟁력 있는 성능(79.8%)을 보이지만 대학원 수준의 추론 작업에서는 변동성이 있습니다.
이 연구는 이러한 주요 모델들 간의 비용, 컨텍스트 윈도우 크기, 신뢰성 측면의 트레이드오프를 강조하여 사용자가 정보에 기반한 결정을 내릴 수 있도록 돕는 것을 목표로 합니다.