Una evaluación de los modelos o3 y o4-mini de OpenAI en el Examen Final de la Humanidad revela que sus errores de calibración son significativamente menores que los de generaciones anteriores, aunque o3 no es estadísticamente mejor que una línea base aleatoria. El análisis indica que o3 exhibe una cautela generalizada en comparación con predecesores como o1, que tienden a predecir alta confianza en diversas tareas.

  • En el Examen Final de la Humanidad, la distribución de confianza de o3 es casi uniforme, lo que resulta en un error de calibración menor que el de otros modelos que tienen un rendimiento peor que una línea base aleatoria.
  • Las curvas de calibración muestran ninguna correlación visual fuerte entre precisión y confianza para o3, sugiriendo que su menor confianza promedio en tareas difíciles impulsa la métrica en lugar de una autoconciencia precisa.
  • En el conjunto de datos saturado GSM8k, o3 sigue siendo excesivamente cauteloso mientras que o4-mini está mejor calibrado; sin embargo, modificar el prompt para solicitar razonamiento para las puntuaciones de confianza reduce el error de calibración de o3 del 24% al 9%.

Los hallazgos sugieren que, aunque los nuevos modelos de OpenAI están mejor calibrados que sus predecesores, tienen dificultades con la elicitation consistente de confianza, particularmente en tareas fáciles donde permanecen excesivamente cautelosos.