La fondation ARC Prize a publié sa première analyse publique des modèles o3 et o4-mini d'OpenAI sur les benchmarks de raisonnement ARC-AGI. L'évaluation révèle que, bien que ces modèles de pointe montrent des progrès significatifs, ils n'ont pas encore résolu l'ensemble difficile ARC-AGI-2.
- o3-medium a obtenu 53 % sur l'ensemble Semi Private Eval d'ARC-AGI-1, tandis qu'o4-mini-medium a atteint 41 % avec une grande efficacité.
- Les deux modèles o3 et o4-mini ont obtenu moins de 3 % au benchmark plus exigeant ARC-AGI-2.
- Les paramètres de raisonnement élevés ont entraîné une couverture incomplète en raison de dépassements de délai ou de sorties manquantes, rendant ces résultats inadaptés aux classements.
- Le modèle o3 de production diffère du précédent o3-preview par l'intégration d'entrées visuelles et l'utilisation de contraintes différentes lors de l'entraînement.
Ces résultats mettent en évidence qu'ARC-AGI-1 reste un outil sensible pour mesurer les capacités actuelles des modèles, tandis qu'ARC-AGI-2 sert de benchmark de nouvelle génération pour les futurs modèles comblant l'écart entre le raisonnement humain et celui de l'IA.