Penulis proyek sumber terbuka Tura melaporkan bahwa penggunaan eksekusi makro dengan Codex CLI 0.144.1 dan GPT-5.6-sol secara signifikan mengurangi putaran interaksi dan biaya di seluruh 60 sesi debug dan penulisan ulang DeepSWE.
- Makro + penalaran mundur mencapai tingkat keberhasilan 80,0% (48/60) dengan menggunakan 2.017 putaran dan $221.138.
- Makro Langsung mencapai tingkat keberhasilan 65,0% (39/60) dengan hanya 969 putaran dan $99.620.
- Dibandingkan dengan Codex CLI High, Makro Langsung menggunakan 84,0% lebih sedikit putaran dan 83,5% lebih sedikit token yang diamati sambil mempertahankan tingkat keberhasilan 5 poin lebih tinggi.
- Pendekatan makro mendefinisikan alur kerja deterministik di bawah batas model, mengembalikan bukti gabungan hanya ketika keputusan penalaran baru diperlukan.
Metode ini memungkinkan pengguna menghemat anggaran untuk investigasi dan verifikasi yang lebih kuat dengan menghentikan makro kapan pun bukti baru memerlukan keputusan, daripada pengelompokan buta.