كشف تقييم لنموذجي OpenAI o3 وo4-mini على امتحان Humanity’s Last Exam أن أخطاء معايرتهما أقل بشكل ملحوظ من الأجيال السابقة، رغم أن أداء o3 ليس أفضل إحصائياً من الأساس العشوائي. تشير التحليلات إلى أن o3 يُظهر تحفظاً واسعاً في الثقة مقارنةً بسلفه مثل o1، الذي يميل إلى التنبؤ بثقة عالية عبر المهام.
- على امتحان Humanity’s Last Exam، تكون توزيع ثقة o3 شبه منتظم، مما يؤدي إلى خطأ معايرة أقل من نماذج أخرى تؤدي أسوأ من الأساس العشوائي.
- تُظهر منحنيات المعايرة عدم وجود ارتباط بصري قوي بين الدقة والثقة بالنسبة لـo3، مما يشير إلى أن متوسط ثقته الأقل في المهام الصعبة هو ما يقود هذه القيمة وليس وعيه الذاتي الدقيق.
- على مجموعة البيانات المشبعة GSM8k، يبقى o3 متحفظاً بشأن ثقته بشكل واسع بينما يكون o4-mini مُعايراً بشكل أفضل؛ ومع ذلك، فإن تعديل الموجه لطلب الاستدلال وراء درجات الثقة يقلل خطأ معايرة o3 من 24% إلى 9%.
تشير النتائج إلى أنه رغم أن نماذج OpenAI الأحدث أكثر دقة في المعايرة من سلفها، إلا أنها تواجه صعوبة في استخلاث ثقة متسقة، لا سيما في المهام السهلة حيث تظل متحفظة بشأن ثقتها.