Un examen des systèmes de raisonnement IA de pointe provenant de laboratoires tels qu'OpenAI, DeepMind, xAI, DeepSeek et Anthropic révèle que si l'échelle du calcul au moment du test améliore la précision, elle réduit considérablement l'efficacité. L'analyse identifie une frontière de Pareto pour les scores ARC-AGI-1 mais note un échec complet sur le benchmark plus difficile ARC-AGI-2, suggérant des limitations communes à tous les modèles majeurs.

  • Les systèmes de raisonnement modernes reposent sur une inférence longue, la recomposition des connaissances et l'échantillonnage parallèle de CoT pour étendre le « temps de réflexion ».
  • Le modèle o3-medium/high d'OpenAI offre la plus haute précision à un coût élevé, tandis que Gemini 2.5 Flash de Google propose un équilibre entre précision et coût.
  • Grok 3 mini-low de xAI offre des améliorations modestes de précision par rapport aux LLM purs avec des exigences en ressources inférieures.
  • ARC-AGI-2 reste non résolu par tous les systèmes testés, indiquant que les stratégies d'échelle actuelles sont insuffisantes pour une capacité AGI révolutionnaire.

Les résultats suggèrent qu'il n'y a pas de vainqueur universel unique et que les systèmes de raisonnement IA manquent d'une adéquation produit-marché forte par rapport aux LLM purs en raison d'incohérences API et de frictions à l'adoption.