オープンソースプロジェクトTuraの著者は、Codex CLI 0.144.1およびGPT-5.6-solでマクロ実行を使用することで、60回のDeepSWEデバッグおよび書き換えセッション全体で対話ラウンドとコストが大幅に削減されたと報告しています。

  • マクロ+逆推論は、2,017ラウンドと$221.138を使用して80.0%のパスレート(48/60)を達成しました。
  • マクロダイレクトは、わずか969ラウンドと$99.620で65.0%のパスレート(39/60)を達成しました。
  • Codex CLI Highと比較して、マクロダイレクトはパスレートを5ポイント高く維持しつつ、ラウンド数を84.0%削減し、観測トークンを83.5%削減しました。
  • このマクロアプローチは、モデルの境界以下で決定論的なワークフローを定義し、新しい推論判断が必要になった場合にのみ結合された証拠を返します。

この方法により、ユーザーは新たな証拠が判断を必要とするたびにマクロを停止することで、より強力な調査と検証に予算を節約できます。盲目的なバッチ処理を行うのではなくです。