OpenAI a présenté en avant-première son nouveau modèle de langage de raisonnement o3, signalant un progrès rapide des capacités de l'IA en vue d'une publication publique à la fin janvier 2025. L'annonce met en évidence des sauts de performance significatifs par rapport aux modèles précédents les plus avancés tels que Gemini 1.5 Pro et Claude 3.5 Sonnet.

  • o3 est le premier modèle à dépasser le seuil de 85 % sur l'ensemble public du prix ARC AGI, un benchmark conçu pour mesurer l'intelligence fluide de type humain.
  • Il obtient un score de 25 % sur le benchmark Frontier Math, une augmentation substantielle par rapport au précédent état de l'art de 2 %.
  • Le modèle atteint un niveau de performance de Grand Maître international sur Codeforces et établit un nouvel état de l'art sur SWE-Bench-Verified avec un score de 71,7 %.
  • OpenAI a également publié des recherches sur l'alignement délibératif, démontrant comment les modèles de classe o1 peuvent améliorer les études de sécurité et d'alignement.

Ces résultats suggèrent que les modèles de raisonnement commencent à apporter une valeur au-delà des domaines vérifiables tels que les mathématiques et la programmation, accélérant potentiellement les progrès dans l'écosystème de la recherche en IA.