OpenAI affirme que son modèle o3-mini, doté d'une forte capacité de raisonnement et d'un accès aux outils Python, obtient un score de 32 % au benchmark FrontierMath. Cependant, l'évaluation officielle indépendante d'Epoch rapporte un score nettement inférieur, de seulement 11 %.
- Epoch a construit le benchmark et dispose de meilleurs incitations pour une notation précise.
- OpenAI a signalé un score de 28 % sur le niveau de problèmes le plus difficile, ce qui est suspectement proche de son score global.
- Epoch a publié des informations détaillées sur son infrastructure de test et ses données, tandis qu'OpenAI en a publié très peu.
- L'écart pourrait provenir du fait qu'OpenAI utilise un échafaudage interne plus puissant, plus de calculs lors du test ou un sous-ensemble différent de problèmes (180 contre 290).
La différence de résultats met en lumière l'importance des méthodologies d'évaluation transparentes et de la vérification indépendante dans le benchmarking des grands modèles de langage.