OpenAI a fourni des fonds pour le benchmark mathématique indépendant FrontierMath tout en étant lié par un accord de non-divulgation qui empêchait Epoch AI de révéler cette relation jusqu'après l'annonce par OpenAI des performances records de son modèle o3. Le benchmark, développé par plus de 60 mathématiciens, teste des compétences de raisonnement complexes, et le o3 d'OpenAI a obtenu un taux de réussite de 25,2 %.

  • FrontierMath a été introduit en novembre 2024 pour évaluer les capacités de résolution avancée de problèmes mathématiques.
  • Epoch AI a signé un accord empêchant la divulgation du soutien financier d'OpenAI jusqu'à l'annonce du o3 le 20 décembre.
  • Les problèmes du benchmark ont été créés par une équipe de plus de 60 mathématiciens de premier plan qui ignoraient la source du financement.
  • OpenAI a obtenu l'accès à « beaucoup mais pas tout » des données FrontierMath, bien qu'un accord verbal interdise l'utilisation des matériaux pour l'entraînement des modèles.
  • Epoch AI reconnaît le manque de transparence comme une erreur et promet des informations plus claires sur les sources de financement dans les futures collaborations.

La situation met en lumière la complexité du benchmarking de l'IA et l'importance de la transparence, surtout puisque le raisonnement mathématique est une faiblesse majeure des modèles de langage.