Evaluasi model OpenAI o3 dan o4-mini pada Humanity’s Last Exam mengungkapkan bahwa kesalahan kalibrasi mereka secara signifikan lebih rendah dibandingkan generasi sebelumnya, meskipun o3 tidak secara statistik lebih baik daripada baseline acak. Analisis menunjukkan bahwa o3 menampilkan ketidakpercayaan diri yang luas dibandingkan pendahulunya seperti o1, yang cenderung memprediksi kepercayaan diri tinggi di berbagai tugas.

  • Pada Humanity’s Last Exam, distribusi kepercayaan diri o3 hampir seragam, menghasilkan kesalahan kalibrasi yang lebih rendah daripada model lain yang performanya lebih buruk daripada baseline acak.
  • Kurva kalibrasi menunjukkan tidak ada korelasi visual yang kuat antara akurasi dan kepercayaan diri untuk o3, menunjukkan bahwa rata-rata kepercayaan diri yang lebih rendah pada tugas sulit mendorong metrik tersebut alih-alih kesadaran diri yang tepat.
  • Pada dataset GSM8k yang jenuh, o3 tetap kurang percaya diri secara luas sementara o4-mini lebih terkalibrasi dengan baik; namun, memodifikasi prompt untuk meminta penalaran atas skor kepercayaan diri mengurangi kesalahan kalibrasi o3 dari 24% menjadi 9%.

Temuan ini menunjukkan bahwa meskipun model OpenAI terbaru lebih terkalibrasi dibandingkan pendahulunya, mereka kesulitan dalam elicitation kepercayaan diri yang konsisten, terutama pada tugas mudah di mana mereka tetap kurang percaya diri.