作者引入了代理元推理,这是一种推理时的机制,用于为长周期任务结构化执行选择。控制器通过整合进度并基于紧凑的运行记录(而非完整历史)来分发工作,从而管理整个过程。

在 ProgramBench 上,使用 GPT-5.5 时元推理达到 71.5%,而 Codex 为 58.0%;使用 Opus 4.8 时为 67.2%,而 Claude Code 为 65.5%。在抽象推理、多域长周期推理和证明生成基准测试中,它比直接控制高出 3.6 到 4.2 分。工件图分析显示早期工作的重用率增加以及正确解决方案的覆盖率更高。

结果表明,随着代理扩展到更长的运行,将计算资源用于结构化控制变得越来越重要。