Оценка моделей OpenAI o3 и o4-mini на Humanity’s Last Exam показывает, что их ошибки калибровки значительно ниже, чем у предыдущих поколений, хотя o3 не является статистически лучше случайной выборки. Анализ указывает на то, что o3 проявляет широкую недооценку уверенности по сравнению с предшественниками, такими как o1, которые склонны предсказывать высокую уверенность во всех задачах.
- На Humanity’s Last Exam распределение уверенности o3 почти равномерное, что приводит к меньшей ошибке калибровки по сравнению с другими моделями, показывающими результаты хуже случайной выборки.
- Кривые калибровки не показывают сильной визуальной корреляции между точностью и уверенностью для o3, что предполагает: именно более низкая средняя уверенность на сложных задачах определяет этот показатель, а не точная саморефлексия.
- На насыщенной выборке GSM8k o3 остаётся широко недооценивающей уверенность, тогда как o4-mini лучше откалибрована; однако изменение промпта с запросом обоснования для оценок уверенности снижает ошибку калибровки o3 с 24% до 9%.
Результаты указывают на то, что, хотя новые модели OpenAI лучше откалиброваны по сравнению с предшественниками, они испытывают трудности с последовательным получением адекватных оценок уверенности, особенно на простых задачах, где они остаются излишне осторожными.