OpenAI afirma que su modelo o3-mini, con alta capacidad de razonamiento y acceso a herramientas de Python, obtiene una puntuación del 32% en la prueba FrontierMath. Sin embargo, la evaluación oficial e independiente de Epoch informa una puntuación significativamente menor, de solo el 11%.

  • Epoch construyó la prueba y tiene mejores incentivos para una puntuación precisa.
  • OpenAI informó una puntuación del 28% en el nivel de problemas más difícil, lo cual es sospechosamente cercano a su puntuación general.
  • Epoch ha publicado información extensa sobre su infraestructura de pruebas y datos, mientras que OpenAI ha publicado poco.
  • La discrepancia puede deberse a que OpenAI utiliza un andamiaje interno más potente, más cómputo durante la prueba o un subconjunto diferente de problemas (180 frente a 290).

La diferencia en los resultados destaca la importancia de las metodologías de evaluación transparentes y la verificación independiente en la evaluación de modelos de lenguaje grandes.