Humanity’s Last Exam에서 OpenAI의 o3 및 o4-mini 모델에 대한 평가 결과, 이들의 보정 오차가 이전 세대보다 현저히 낮지만 o3는 무작위 기준선과 통계적으로 유의미한 차이가 없음을 보여준다. 분석에 따르면 o1과 같은 이전 모델들이 다양한 작업에서 높은 신뢰도를 예측하는 경향과 비교할 때 o3는 광범위한 과소신뢰를 나타낸다.

  • Humanity’s Last Exam에서 o3의 신뢰도 분포는 거의 균일하여, 무작위 기준선보다 낮은 성능을 보이는 다른 모델들보다 더 낮은 보정 오차를 기록한다.
  • o3에 대한 보정 곡선은 정확도와 신뢰도 간 강한 시각적 상관관계를 보여주지 않으며, 이는 정교한 자기인식보다는 어려운 작업에서의 낮은 평균 신뢰도가 지표에 영향을 미친다는 것을 시사한다.
  • 포화 상태의 GSM8k 데이터셋에서 o3는 여전히 광범위한 과소신뢰를 보이지만 o4-mini는 더 잘 보정되어 있다. 그러나 신뢰도 점수에 대한 추론을 요청하도록 프롬프트를 수정하면 o3의 보정 오차가 24%에서 9%로 감소한다.

이러한 발견은 새로운 OpenAI 모델들이 이전 세대보다 더 잘 보정되었음을 시사하지만, 특히 과소신뢰가 지속되는 쉬운 작업에서 일관된 신뢰도 도출에는 어려움을 겪고 있음을 보여준다.