OpenAI a annoncé o3, son modèle de raisonnement de nouvelle génération, qui établit de nouveaux records en matière de raisonnement, de codage et de résolution de problèmes mathématiques. Le modèle obtient un score de 75,7 % sur l'évaluation semi-privée ARC-AGI eval en mode faible calcul et de 87,5 % en mode élevé calcul.

  • o3 obtient 75,7 % sur ARC-AGI (faible calcul) et 87,5 % (élevé calcul), dépassant le seuil de niveau humain de 85 %.
  • Il atteint un score de 96,7 % à l'Olympiade américaine de mathématiques 2024 (AIME) et 25,2 % au Frontier Math Benchmark d'EpochAI.
  • En codage, o3 obtient 71,7 sur SWE-Bench Verified (22,8 points de plus que o1) et une cote Elo de 2 727 sur Codeforces.
  • Le modèle dispose d'une fenêtre de contexte de 128K tokens et est notable pour être significativement plus coûteux à exécuter que les itérations précédentes.