Des résultats de benchmark indépendants publiés par Epoch AI montrent que le modèle o3, lancé publiquement par OpenAI, a obtenu environ 10 % sur l'ensemble de données FrontierMath, loin des plus de 25 % initialement mis en avant par l'entreprise lors de son dévoilement en décembre.
- Epoch AI a évalué le modèle o3 publié en utilisant une version mise à jour du benchmark FrontierMath et a trouvé un score d'environ 10 %.
- L'affirmation initiale d'OpenAI dépassant les 25 % a été obtenue en utilisant des paramètres de calcul agressifs au moment du test sur un échafaudage interne plus puissant que la version publique.
- La fondation ARC Prize a confirmé que le o3 public est ajusté pour le chat et l'utilisation produit, avec des niveaux de calcul inférieurs à ceux de la version preview qu'ils ont testée.
- Le personnel technique d'OpenAI a déclaré que le modèle de production est optimisé pour l'efficacité des coûts et la vitesse plutôt que pour les performances maximales aux benchmarks.
L'écart met en lumière l'importance de vérifier les benchmarks tiers et précise que le modèle publié privilégie l'utilité réelle par rapport aux scores académiques maximaux.