Analisis komparatif mengevaluasi kemampuan Claude 3.7 Sonnet, Claude 3.5 Sonnet, OpenAI o3-mini, DeepSeek R1, dan Grok 3 Beta pada benchmark matematika, pemrograman, dan penalaran.
- Pada GPQA Diamond, Grok 3 Beta mencapai 84,6% dengan penalaran ekstensi, sementara Claude 3.7 Sonnet mencapai 84,8% dalam mode yang sama.
- Dalam kompetisi matematika AIME, Grok 3 Beta memimpin dengan 93,3%, sedangkan Claude 3.7 Sonnet mencetak skor 61,3% tetapi unggul pada Math500 di 96,2%.
- OpenAI o3-mini menunjukkan kinerja kuat pada AIME (hingga 83,3%) dan GPQA Diamond (78% dalam mode komputasi tinggi) dengan fokus pada efisiensi biaya.
- DeepSeek R1 bersaing secara kompetitif pada AIME (79,8%) tetapi menunjukkan variabilitas pada tugas penalaran tingkat pascasarjana.
Studi ini bertujuan membantu pengguna membuat keputusan yang tepat dengan menyoroti pertukaran antara biaya, ukuran jendela konteks, dan keandalan di antara model-model terkemuka ini.