OpenAI, DeepMind, xAI, DeepSeek, Anthropic 등 주요 연구소의 최전선 AI 추론 시스템을 검토한 결과, 테스트 시간 컴퓨팅 확장(scaling)이 정확도를 향상시키지만 효율성을 크게 저하시키는 것으로 드러났다. 이 분석은 ARC-AGI-1 점수에 대한 파레토 프론티어(Pareto frontier)를 식별했지만, 더 어려운 ARC-AGI-2 벤치마크에서는 완전한 실패를 보였으며, 이는 모든 주요 모델에 공통적인 한계를 시사한다.

  • 현대적 추론 시스템은 "생각하는 시간"을 연장하기 위해 장시간 추론, 지식 재구성, 병렬 CoT 샘플링에 의존한다.
  • OpenAI의 o3-medium/high는 높은 비용으로 최고 정확도를 제공하며, Google의 Gemini 2.5 Flash는 정확도와 비용 간의 균형을 제공한다.
  • xAI의 Grok 3 mini-low는 낮은 자원 요구사항으로 순수 LLM 대비 modest한 정확도 개선을 제공한다.
  • ARC-AGI-2는 테스트된 모든 시스템에서 해결되지 않았으며, 이는 현재 확장 전략이 돌파적인 AGI 능력을 달성하기에 불충분함을 나타낸다.

이 결과는 단일 보편적 우승자가 없으며, API 불일치와 채택 장벽으로 인해 AI 추론 시스템이 순수 LLM 대비 강력한 제품-시장 적합성(product-market fit)을 결여하고 있음을 시사한다.