OpenAI afirma que su modelo o3-mini, con alta capacidad de razonamiento y acceso a herramientas de Python, obtiene una puntuación del 32% en la prueba FrontierMath. Sin embargo, la evaluación oficial e independiente de Epoch informa una puntuación significativamente menor, de solo el 11%.
- Epoch construyó la prueba y tiene mejores incentivos para una puntuación precisa.
- OpenAI informó una puntuación del 28% en el nivel de problemas más difícil, lo cual es sospechosamente cercano a su puntuación general.
- Epoch ha publicado información extensa sobre su infraestructura de pruebas y datos, mientras que OpenAI ha publicado poco.
- La discrepancia puede deberse a que OpenAI utiliza un andamiaje interno más potente, más cómputo durante la prueba o un subconjunto diferente de problemas (180 frente a 290).
La diferencia en los resultados destaca la importancia de las metodologías de evaluación transparentes y la verificación independiente en la evaluación de modelos de lenguaje grandes.