El nuevo modelo de lenguaje de OpenAI, o3, logró una puntuación del 25% en FrontierMath, un conjunto de datos secreto compuesto por cientos de preguntas difíciles de matemáticas curadas por Epoch AI. El conjunto de datos consiste en problemas con respuestas definitivas y computables que pueden verificarse automáticamente, diseñados para evitar que los modelos simplemente memoricen soluciones públicas.

  • FrontierMath contiene "cientos" de preguntas difíciles de matemáticas, con menos de 200 publicadas inicialmente y más añadidas posteriormente.
  • Los cinco problemas de muestra públicamente disponibles requieren respuestas en números enteros positivos, como 9811 y 367707, e involucran conceptos complejos como la continuidad p-ádica y las conjeturas de Weil.
  • Aunque el autor pudo resolver dos de las cinco preguntas públicas utilizando su experiencia en aritmética, señaló que un estudiante universitario típico de matemáticas probablemente tendría dificultades incluso con una sola.
  • Elliot Glazer de Epoch AI sugirió que el 25% del conjunto de datos consiste en "problemas estilo IMO/graduado", planteando dudas sobre el nivel general de dificultad y la representatividad de las muestras públicas.

El logro es significativo porque el área de IA para matemáticas carece de conjuntos de datos difíciles, y crear tales benchmarks es difícil y costoso. El autor expresó asombro ante la puntuación, señalando que, aunque la IA está mejorando rápidamente en problemas estilo Olimpiada, alcanzar una innovación a nivel de grado avanzado o doctorado se consideraba anteriormente un objetivo lejano.