Автор проекта с открытым исходным кодом Tura сообщает, что использование макро-выполнения с Codex CLI 0.144.1 и GPT-5.6-sol значительно сократило количество раундов взаимодействия и затраты в ходе 60 сессий отладки и переписывания DeepSWE.

  • Макро + обратное рассуждение достигло уровня прохождения 80,0% (48/60), используя 2 017 раундов и $221,138.
  • Прямое макро достигло уровня прохождения 65,0% (39/60) всего за 969 раундов и $99,620.
  • По сравнению с Codex CLI High, прямое макро использовало на 84,0% меньше раундов и на 83,5% меньше наблюдаемых токенов, сохраняя при этом уровень прохождения на 5 пунктов выше.
  • Подход с использованием макро определяет детерминированные рабочие процессы ниже границы модели, возвращая объединённые доказательства только тогда, когда требуются новые решения по рассуждению.

Этот метод позволяет пользователям экономить бюджет для более глубокого исследования и проверки, останавливая макро всякий раз, когда новые доказательства требуют принятия решения, а не выполняя слепую пакетную обработку.