أعلنت OpenAI عن إطلاق o3، وهو نموذجها للاستدلال من الجيل القادم، والذي يضع أرقامًا قياسية جديدة في مجالات الاستدلال والبرمجة وحل المسائل الرياضية. يحقق النموذج نتيجة بنسبة 75.7٪ على تقييم ARC-AGI شبه الخاص في وضع الحساب المنخفض و87.5٪ في وضع الحساب العالي.

  • يحقق o3 نتيجة بنسبة 75.7٪ على ARC-AGI (حساب منخفض) و87.5٪ (حساب عالي)، متجاوزًا عتبة المستوى البشري البالغة 85٪.
  • يحقق نتيجة بنسبة 96.7٪ في أولمبياد الرياضيات الأمريكي لعام 2024 (AIME) و25.2٪ في Frontier Math Benchmark من EpochAI.
  • في البرمجة، يحصل o3 على 71.7 على SWE-Bench Verified (أعلى بـ 22.8 نقطة من o1) ونتيجة Elo تبلغ 2,727 على Codeforces.
  • يمتلك النموذج نافذة سياق بحجم 128K توكن ويُعرف بأنه أكثر تكلفة بشكل كبير للتشغيل مقارنة بالإصدارات السابقة.