开源项目Tura的作者报告称,在60个DeepSWE调试和重写会话中,使用带有Codex CLI 0.144.1和GPT-5.6-sol的宏执行显著减少了交互轮次和成本。

  • 宏+反向推理实现了80.0%的通过率(48/60),使用了2,017轮次和$221.138。
  • 宏直接方式实现了65.0%的通过率(39/60),仅使用969轮次和$99.620。
  • 与Codex CLI High相比,宏直接方式减少了84.0%的轮次和83.5%的观察到的标记数,同时保持了5个百分点更高的通过率。
  • 宏方法在模型边界下方定义了确定性工作流,仅在新推理决策需要时才返回合并的证据。

这种方法允许用户通过在需要新证据进行决策时停止宏(而不是盲目批处理)来节省预算用于更强的调查和验证。