L'auteur du projet open-source Tura rapporte que l'utilisation de l'exécution de macros avec Codex CLI 0.144.1 et GPT-5.6-sol a considérablement réduit le nombre de tours d'interaction et les coûts sur 60 sessions de débogage et de réécriture DeepSWE.
- Macro + raisonnement rétroactif a obtenu un taux de réussite de 80,0 % (48/60) en utilisant 2 017 tours et 221,138 $.
- Macro Direct a obtenu un taux de réussite de 65,0 % (39/60) avec seulement 969 tours et 99,620 $.
- Par rapport à Codex CLI High, Macro Direct a utilisé 84,0 % moins de tours et 83,5 % moins de tokens observés tout en maintenant un taux de réussite supérieur de 5 points.
- L'approche par macros définit des workflows déterministes en dessous de la limite du modèle, ne renvoyant les preuves combinées que lorsque de nouvelles décisions de raisonnement sont nécessaires.
Cette méthode permet aux utilisateurs d'économiser leur budget sur une investigation et une vérification plus poussées en arrêtant les macros dès que de nouvelles preuves nécessitent une décision, plutôt que par regroupement aveugle.