تُقيّم التحليلات المقارنة قدرات Claude 3.7 Sonnet و Claude 3.5 Sonnet و OpenAI o3-mini و DeepSeek R1 و Grok 3 Beta عبر معايير التقييم في الرياضيات والبرمجة والاستدلال.

  • على GPQA Diamond، يصل Grok 3 Beta إلى 84.6% مع الاستدلال الموسع، بينما يحقق Claude 3.7 Sonnet 84.8% في نفس الوضع.
  • في مسابقات AIME الرياضية، يتصدر Grok 3 Beta بنسبة 93.3%، بينما يسجل Claude 3.7 Sonnet 61.3% لكنه يتفوق على Math500 بنسبة 96.2%.
  • يُظهر OpenAI o3-mini أداءً قوياً على AIME (حتى 83.3%) و GPQA Diamond (78% في وضع الحوسبة الأعلى) مع التركيز على الكفاءة من حيث التكلفة.
  • يؤدي DeepSeek R1 أداءً تنافسياً على AIME (79.8%) لكنه يُظهر تبايناً في مهام الاستدلال على مستوى الدراسات العليا.

تهدف الدراسة إلى مساعدة المستخدمين على اتخاذ قرارات مستنيرة من خلال تسليط الضوء على المقايضات في التكلفة وحجم نافذة السياق والموثوقية عبر هذه النماذج الرائدة.