著者は、長期のタスクに対する実行選択を構造化する推論時のハーネスであるエージェント型メタ推論を紹介します。コントローラーは、完全な履歴ではなくコンパクトなランアカウントに基づいて進捗を統合し、作業をディスパッチすることでプロセスを管理します。

ProgramBenchでは、GPT-5.5で71.5%、Codexに対して58.0%、Opus 4.8で67.2%、Claude Codeに対して65.5%を達成しました。抽象推論、マルチドメイン長期推論、証明生成ベンチマークでは、直接制御と比較して3.6〜4.2ポイントの向上が見られました。アーティファクトグラフ分析により、以前の作業の再利用が増加し、正しいソリューションのカバレッジが高くなっていることが示されました。

結果は、エージェントがより長いランにスケールするにつれて、構造化された制御への計算リソースの投入がますます重要になることを示しています。