对来自OpenAI、DeepMind、xAI、DeepSeek和Anthropic等实验室的前沿AI推理系统的审查显示,虽然测试时计算扩展提高了准确性,但显著降低了效率。分析确定了ARC-AGI-1分数的帕累托前沿,但指出在更具挑战性的ARC-AGI-2基准上完全失败,表明所有主要模型存在共同局限性。

  • 现代推理系统依赖长时间运行的推理、知识重组和并行CoT采样来延长“思考时间”。
  • OpenAI的o3-medium/high以高成本提供最高准确性,而Google的Gemini 2.5 Flash在准确性和成本之间取得平衡。
  • xAI的Grok 3 mini-low相比纯LLM提供适度的准确性提升,且资源需求更低。
  • ARC-AGI-2仍未被任何测试系统解决,表明当前的扩展策略不足以实现突破性AGI能力。

研究结果表明,不存在单一的通用赢家,由于API不一致和采用摩擦,AI推理系统与纯LLM相比缺乏强大的产品市场契合度。