Los resultados de evaluación independientes publicados por Epoch AI muestran que el modelo o3 lanzado públicamente por OpenAI obtuvo aproximadamente un 10% en el conjunto de datos FrontierMath, quedándose significativamente por debajo del puntaje superior al 25% que la empresa destacó inicialmente durante su presentación en diciembre.

  • Epoch AI evaluó el modelo o3 liberado utilizando una versión actualizada de la evaluación FrontierMath y encontró un puntaje de alrededor del 10%.
  • La afirmación inicial de OpenAI de más del 25% se logró utilizando configuraciones agresivas de cómputo en tiempo de prueba sobre un andamiaje interno más potente que el lanzamiento público.
  • La Fundación ARC Prize confirmó que el o3 público está ajustado para uso de chat y productos, con niveles de cómputo menores que la versión de vista previa que probaron.
  • El personal técnico de OpenAI declaró que el modelo de producción está optimizado para la eficiencia de costos y la velocidad en lugar del máximo rendimiento en evaluaciones.

La discrepancia resalta la importancia de verificar las evaluaciones de terceros y aclara que el modelo liberado prioriza la utilidad del mundo real sobre los puntajes académicos máximos.