Le nouveau modèle de langage d'OpenAI, o3, a obtenu un score de 25 % sur FrontierMath, un ensemble de données secret composé de centaines de questions de mathématiques difficiles sélectionnées par Epoch AI. L'ensemble de données comprend des problèmes avec des réponses définies et calculables qui peuvent être vérifiées automatiquement, conçues pour empêcher les modèles de simplement mémoriser des solutions publiques.

  • FrontierMath contient « des centaines » de questions de mathématiques difficiles, avec moins de 200 initialement publiées et d'autres ajoutées par la suite.
  • Les cinq problèmes d'échantillon publiquement disponibles nécessitent des réponses en nombres entiers positifs, comme 9811 et 367707, et impliquent des concepts complexes tels que la continuité p-adique et les conjectures de Weil.
  • Bien que l'auteur ait pu résoudre deux des cinq questions publiques grâce à son expertise en arithmétique, il a noté qu'un étudiant typique en mathématiques au niveau licence aurait probablement du mal avec même une seule question.
  • Elliot Glazer d'Epoch AI a suggéré que 25 % de l'ensemble de données se compose de « problèmes de style IMO/licence », soulevant des questions sur le niveau de difficulté global et la représentativité des échantillons publics.

Cette performance est significative car le domaine de l'IA pour les mathématiques manque d'ensembles de données difficiles, et la création de tels benchmarks est difficile et coûteuse. L'auteur a exprimé son étonnement face à ce score, notant que si l'IA s'améliore rapidement sur les problèmes de style olympiade, atteindre une innovation de niveau licence avancée ou doctorat était auparavant considéré comme un objectif lointain.