Humanity’s Last Exam पर OpenAI के o3 और o4-mini मॉडल्स का मूल्यांकन दर्शाता है कि उनकी कैलिब्रेशन त्रुटियां पिछली पीढ़ियों की तुलना में काफी कम हैं, हालांकि o3 यादृच्छिक आधार रेखा से सांख्यिकीय रूप से बेहतर नहीं है। विश्लेषण संकेत देता है कि o3 o1 जैसे पूर्वजों की तुलना में व्यापक अतिसुरक्षितता प्रदर्शित करता है, जो विभिन्न कार्यों पर उच्च आत्मविश्वास का अनुमान लगाते हैं।
- Humanity’s Last Exam पर, o3 का आत्मविश्वास वितरण लगभग समान है, जिसके कारण अन्य मॉडल्स की तुलना में कम कैलिब्रेशन त्रुटि होती है जो यादृच्छिक आधार रेखा से भी खराब प्रदर्शन करते हैं।
- कैलिब्रेशन वक्र दर्शाते हैं कि o3 के लिए सटीकता और आत्मविश्वास के बीच कोई मजबूत दृश्य सहसंबंध नहीं है, जो सुझाव देता है कि कठिन कार्यों पर इसका कम औसत आत्मविश्वास मापदंड को चला रहा है न कि सटीक स्व-जागरूकता।
- संतुष्ट GSM8k डेटासेट पर, o3 व्यापक रूप से अतिसुरक्षित बना रहता है जबकि o4-mini बेहतर कैलिब्रेटेड है; हालांकि, आत्मविश्वास स्कोरों के लिए तर्क मांगने हेतु प्रॉम्प्ट को संशोधित करने से o3 की कैलिब्रेशन त्रुटि 24% से घटकर 9% हो जाती है।
निष्कर्ष सुझाव देते हैं कि जबकि नए OpenAI मॉडल्स पूर्वजों की तुलना में बेहतर कैलिब्रेटेड हैं, वे विशेष रूप से आसान कार्यों पर जहां वे अतिसुरक्षित बना रहते हैं, निरंतर आत्मविश्वास उत्पन्न करने में संघर्ष करते हैं।