Uma revisão dos sistemas de raciocínio de ponta de laboratórios como OpenAI, DeepMind, xAI, DeepSeek e Anthropic revela que, embora o escalonamento de computação no tempo de teste melhore a precisão, ele reduz significativamente a eficiência. A análise identifica uma fronteira de Pareto para as pontuações ARC-AGI-1, mas nota falha completa no benchmark mais desafiador ARC-AGI-2, sugerindo limitações comuns em todos os principais modelos.
- Sistemas modernos de raciocínio dependem de inferência de longa duração, recomposição de conhecimento e amostragem paralela de CoT para estender o "tempo de pensamento".
- O o3-medium/high da OpenAI oferece a maior precisão a um alto custo, enquanto o Gemini 2.5 Flash do Google proporciona um equilíbrio entre precisão e custo.
- O Grok 3 mini-low da xAI oferece melhorias modestas de precisão em relação aos LLMs puros, com requisitos menores de recursos.
- O ARC-AGI-2 continua não resolvido por todos os sistemas testados, indicando que as estratégias atuais de escalonamento são insuficientes para uma capacidade de AGI revolucionária.
As descobertas sugerem que não há um único vencedor universal e que os sistemas de raciocínio de IA carecem de forte ajuste entre produto e mercado em comparação com LLMs puros, devido a inconsistências na API e atrito na adoção.