Humanity’s Last Exam पर OpenAI के o3 और o4-mini मॉडल्स का मूल्यांकन दर्शाता है कि उनकी कैलिब्रेशन त्रुटियां पिछली पीढ़ियों की तुलना में काफी कम हैं, हालांकि o3 यादृच्छिक आधार रेखा से सांख्यिकीय रूप से बेहतर नहीं है। विश्लेषण संकेत देता है कि o3 o1 जैसे पूर्वजों की तुलना में व्यापक अतिसुरक्षितता प्रदर्शित करता है, जो विभिन्न कार्यों पर उच्च आत्मविश्वास का अनुमान लगाते हैं।

  • Humanity’s Last Exam पर, o3 का आत्मविश्वास वितरण लगभग समान है, जिसके कारण अन्य मॉडल्स की तुलना में कम कैलिब्रेशन त्रुटि होती है जो यादृच्छिक आधार रेखा से भी खराब प्रदर्शन करते हैं।
  • कैलिब्रेशन वक्र दर्शाते हैं कि o3 के लिए सटीकता और आत्मविश्वास के बीच कोई मजबूत दृश्य सहसंबंध नहीं है, जो सुझाव देता है कि कठिन कार्यों पर इसका कम औसत आत्मविश्वास मापदंड को चला रहा है न कि सटीक स्व-जागरूकता।
  • संतुष्ट GSM8k डेटासेट पर, o3 व्यापक रूप से अतिसुरक्षित बना रहता है जबकि o4-mini बेहतर कैलिब्रेटेड है; हालांकि, आत्मविश्वास स्कोरों के लिए तर्क मांगने हेतु प्रॉम्प्ट को संशोधित करने से o3 की कैलिब्रेशन त्रुटि 24% से घटकर 9% हो जाती है।

निष्कर्ष सुझाव देते हैं कि जबकि नए OpenAI मॉडल्स पूर्वजों की तुलना में बेहतर कैलिब्रेटेड हैं, वे विशेष रूप से आसान कार्यों पर जहां वे अतिसुरक्षित बना रहते हैं, निरंतर आत्मविश्वास उत्पन्न करने में संघर्ष करते हैं।