Una revisión de los sistemas de razonamiento de IA de vanguardia de laboratorios como OpenAI, DeepMind, xAI, DeepSeek y Anthropic revela que, aunque la escalabilidad del cómputo durante la prueba mejora la precisión, reduce significativamente la eficiencia. El análisis identifica una frontera de Pareto para las puntuaciones ARC-AGI-1 pero señala un fallo completo en la benchmark más desafiante ARC-AGI-2, lo que sugiere limitaciones comunes en todos los modelos principales.

  • Los sistemas de razonamiento modernos dependen de inferencias de larga duración, recomposición del conocimiento y muestreo paralelo de CoT para extender el "tiempo de reflexión".
  • El o3-medium/high de OpenAI ofrece la mayor precisión a un alto costo, mientras que Gemini 2.5 Flash de Google proporciona un equilibrio entre precisión y costo.
  • Grok 3 mini-low de xAI ofrece mejoras modestas en la precisión sobre los LLM puros con menores requisitos de recursos.
  • ARC-AGI-2 sigue sin resolverse por todos los sistemas probados, lo que indica que las estrategias de escalado actuales son insuficientes para lograr capacidades AGI revolucionarias.

Los hallazgos sugieren que no hay un único ganador universal y que los sistemas de razonamiento de IA carecen de una fuerte adecuación al mercado en comparación con los LLM puros debido a inconsistencias en la API y fricción en la adopción.