比較分析により、Claude 3.7 Sonnet、Claude 3.5 Sonnet、OpenAI o3-mini、DeepSeek R1、Grok 3 Betaの数学、コーディング、推論ベンチマークにおける能力が評価された。
- GPQA Diamondにおいて、Grok 3 Betaは拡張推論で84.6%を達成し、Claude 3.7 Sonnetは同モードで84.8%を記録した。
- AIME数学コンテストでは、Grok 3 Betaが93.3%で首位だが、Claude 3.7 Sonnetは61.3%にとどまりつつもMath500では96.2%の優れた成績を示した。
- OpenAI o3-miniはコスト効率を重視し、AIME(最大83.3%)およびGPQA Diamond(高計算モードで78%)で強力なパフォーマンスを発揮した。
- DeepSeek R1はAIMEで79.8%と競争力のある結果を示したが、大学院レベルの推論タスクではばらつきが見られた。
本研究は、これらの主要モデル間のコスト、コンテキストウィンドウサイズ、信頼性のトレードオフを強調することで、ユーザーが情報に基づいた判断を下せるよう支援することを目的としている。