Une évaluation des modèles o3 et o4-mini d'OpenAI sur Humanity’s Last Exam révèle que leurs erreurs de calibration sont significativement inférieures à celles des générations précédentes, bien que o3 ne soit pas statistiquement meilleur qu'une baseline aléatoire. L'analyse indique que o3 présente une sous-confiance généralisée par rapport aux prédécesseurs comme o1, qui ont tendance à prédire une forte confiance sur l'ensemble des tâches.
- Sur Humanity’s Last Exam, la distribution de confiance de o3 est presque uniforme, ce qui entraîne une erreur de calibration inférieure à celle d'autres modèles qui performant pire qu'une baseline aléatoire.
- Les courbes de calibration montrent aucune corrélation visuelle forte entre la précision et la confiance pour o3, suggérant que sa confiance moyenne plus faible sur les tâches difficiles est le moteur de cette métrique plutôt qu'une auto-conscience précise.
- Sur le jeu de données saturé GSM8k, o3 reste largement sous-confiant tandis que o4-mini est mieux calibré ; cependant, modifier l'invite pour demander un raisonnement derrière les scores de confiance réduit l'erreur de calibration de o3 de 24 % à 9 %.
Les résultats suggèrent que bien que les nouveaux modèles d'OpenAI soient mieux calibrés que leurs prédécesseurs, ils peinent avec une elicitation cohérente de la confiance, en particulier sur les tâches faciles où ils restent sous-confiants.