OpenAI a annoncé son nouveau modèle o3, qui a obtenu un score de 25 % au benchmark Frontier Math, une avancée significative par rapport à la moyenne précédente de 2 % pour les IA génératives. Ce résultat met en évidence les améliorations rapides des capacités de raisonnement mathématique de l'IA.
- Frontier Math est un benchmark privé composé de questions mathématiques difficiles, conçu pour tester des capacités similaires à celles des humains sans s'appuyer sur des données mémorisées.
- Le modèle o3 utilise des chaînes de pensée itératives, lui permettant d'évaluer et de corriger ses propres étapes de raisonnement avant de répondre.
- Ce processus nécessite un calcul substantiel, certaines questions individuelles coûtant plus de 1000 dollars à répondre.
- Contrairement aux modèles spécialisés comme AlphaProof de Google DeepMind, o3 est une IA générale qui démontre des compétences mathématiques avancées.
L'article suggère que si les coûts diminuent et que les scores s'améliorent, les mathématiciens IA pourraient transformer les méthodes formelles en automatisant les processus de vérification actuellement limités par le manque d'experts humains.