OpenAI proporcionó financiación para el benchmark matemático independiente FrontierMath mientras estaba sujeto a un acuerdo de confidencialidad que impedía a Epoch AI revelar esta relación hasta después de que OpenAI anunciara el rendimiento histórico de su modelo o3. El benchmark, desarrollado por más de 60 matemáticos, evalúa habilidades de razonamiento complejo, y el o3 de OpenAI logró una tasa de éxito del 25,2 % en él.

  • FrontierMath se presentó en noviembre de 2024 para evaluar capacidades avanzadas de resolución de problemas matemáticos.
  • Epoch AI firmó un acuerdo que impedía revelar el apoyo financiero de OpenAI hasta el anuncio de o3 el 20 de diciembre.
  • Los problemas del benchmark fueron creados por un equipo de más de 60 matemáticos destacados que desconocían la fuente de financiación.
  • OpenAI obtuvo acceso a "mucho pero no todo" los datos de FrontierMath, aunque un acuerdo verbal prohibía utilizar el material para entrenar modelos.
  • Epoch AI reconoce la falta de transparencia como un error y promete información más clara sobre las fuentes de financiación en futuras colaboraciones.

La situación destaca la complejidad de la evaluación de benchmarks de IA y la importancia de la transparencia, especialmente dado que el razonamiento matemático es una debilidad importante para los modelos de lenguaje.