O novo modelo de linguagem da OpenAI, o3, alcançou uma pontuação de 25% no FrontierMath, um conjunto de dados sigiloso com centenas de questões difíceis de matemática curadas pela Epoch AI. O conjunto de dados consiste em problemas com respostas definitivas e computáveis que podem ser verificadas automaticamente, projetado para impedir que os modelos simplesmente memorizem soluções públicas.

  • FrontierMath contém "centenas" de questões difíceis de matemática, com menos de 200 inicialmente lançadas e mais adicionadas posteriormente.
  • As cinco amostras de problemas publicamente disponíveis exigem respostas em números inteiros positivos, como 9811 e 367707, e envolvem conceitos complexos como continuidade p-ádica e conjecturas de Weil.
  • Embora o autor pudesse resolver duas das cinco questões públicas usando sua expertise em aritmética, ele observou que um estudante típico de graduação em matemática provavelmente teria dificuldades até mesmo com uma delas.
  • Elliot Glazer, da Epoch AI, sugeriu que 25% do conjunto de dados consiste em "problemas no estilo IMO/graduação", levantando questões sobre o nível geral de dificuldade e a representatividade das amostras públicas.

A conquista é significativa porque a área de IA para matemática carece de conjuntos de dados difíceis, e criar tais benchmarks é difícil e caro. O autor expressou choque com a pontuação, observando que, embora a IA esteja melhorando rapidamente em problemas no estilo Olimpíada, alcançar inovação de nível de graduação avançada ou doutorado era anteriormente considerado um objetivo distante.