Le nouveau système o3 d'OpenAI, entraîné sur l'ensemble de formation public ARC-AGI-1, a obtenu 75,7 % sur l'ensemble d'évaluation semi-privé dans une limite de calcul de 10 000 $ et 87,5 % avec une configuration à haut calcul.
- Le score d'efficacité élevée est qualifié comme 1ère place sur le classement public selon les règles ARC-AGI-Pub.
- Les tests ont été effectués à deux niveaux de calcul : 6 échantillons pour l'efficacité élevée et 1024 échantillons (172x le calcul) pour l'efficacité faible.
- OpenAI a confirmé que la version testée diffère de la o3 officiellement publiée, avec des résultats mis à jour à venir.
ARC Prize considère cela comme une augmentation significative des capacités de l'IA, démontrant de nouvelles capacités d'adaptation aux tâches non observées dans les modèles précédents de la famille GPT.