2024年ARC Prizeコンペティションの終了時、2件の新しい検証済み提出物がARC-AGI Public Leaderboard(ARC-AGI-Pub)で最良スコアを達成しました。ジェレミー・バーマンはClaude Sonnet 3.5を用いた進化的なテスト時の計算アプローチにより53.6%を獲得し、MITとコーネル大学の合同チームはテスト時のトレーニングを通じて47.5%の精度を達成しました。
ジェレミー・バーマンの方法は、局所最適解を避けるためにPythonの変換関数を反復的に生成・精緻化し、タスクごとに最大500個の関数を生成します。MIT/コーネルの共同研究は、補完的な誘導および伝達技術を活用し、8Bパラメータの言語モデルにおいてベースラインのファインチューニング済みモデルに対して6倍の精度向上を実現しました。
これらの結果は、緩和された計算制約を用いてARC-AGIベンチマークに対して最先端モデルをテストする上で、著しい進歩を示しています。