أعلنت OpenAI عن النسخة الأولية من نموذجها اللغوي الجديد o3 للاستدلال، مما يشير إلى تقدم سريع في قدرات الذكاء الاصطناعي قبل الإطلاق العام المقرر في أواخر يناير 2025. وتسلط هذه الإعلانات الضوء على قفزات أداء كبيرة مقارنة بالنماذج السابقة المتقدمة مثل Gemini 1.5 Pro و Claude 3.5 Sonnet.

  • يُعد o3 أول نموذج يتجاوز عتبة 85% على المجموعة العامة لجائزة ARC AGI، وهو معيار مصمم لقياس الذكاء المرن الشبيه بالبشر.
  • يحقق نتيجة بنسبة 25% على معيار Frontier Math، وهو زيادة كبيرة مقارنة بالنتيجة السابقة البالغة 2%.
  • يصل أداء النموذج إلى مستوى الأستاذ الكبير الدولي في Codeforces ويضع نتيجة قياسية جديدة على SWE-Bench-Verified بنتيجة تبلغ 71.7%.
  • أصدرت OpenAI أيضاً أبحاثاً حول المحاذاة التأملية، توضح كيف يمكن لنماذج الفئة o1 تعزيز دراسات السلامة والمحاذاة.

تشير هذه النتائج إلى أن نماذج الاستدلال بدأت في تقديم قيمة تتجاوز المجالات القابلة للتحقق مثل الرياضيات والبرمجة، مما قد يسرع التقدم عبر نظام الذكاء الاصطناعي البحثي.