OpenAI、DeepMind、xAI、DeepSeek、Anthropicなどのラボからの最先端AI推論システムをレビューした結果、テスト時の計算量のスケーリングが精度を向上させる一方で、効率性を大幅に低下させることが明らかになった。この分析はARC-AGI-1スコアのパレートフロンティアを特定したが、より困難なARC-AGI-2ベンチマークでは完全な失敗を示し、主要なモデルすべてに共通する制限があることを示唆している。

  • 現代の推論システムは、「考える時間」を延長するために長時間の実行、知識の再構成、および並列CoTサンプリングに依存している。
  • OpenAIのo3-medium/highは高いコストで最高精度を提供し、GoogleのGemini 2.5 Flashは精度とコストのバランスを提供する。
  • xAIのGrok 3 mini-lowは、純粋なLLMと比較して modest な精度向上を、より低いリソース要件で提供している。
  • ARC-AGI-2はテストされたすべてのシステムによって未解決であり、現在のスケーリング戦略が画期的なAGI能力には不十分であることを示している。

これらの知見は、単一の普遍的な勝者が存在せず、APIの一貫性の欠如や導入の摩擦により、純粋なLLMと比較してAI推論システムが強力なプロダクトマーケットフィットを欠いていることを示唆している。