Авторы представляют агентное мета-рассуждение, механизм во время вывода, который структурирует выбор выполнения для задач с длинным горизонтом. Контроллер управляет процессом, консолидируя прогресс и распределяя работу на основе компактной записи выполнения, а не полной истории.
На ProgramBench мета-рассуждение достигает 71.5% с GPT-5.5 против 58.0% для Codex, и 67.2% с Opus 4.8 против 65.5% для Claude Code. В задачах абстрактного рассуждения, многодоменного длинного горизонта и генерации доказательств оно дает прирост от 3.6 до 4.2 баллов по сравнению с прямым управлением. Анализ графа артефактов показывает увеличение повторного использования предыдущей работы и более высокое покрытие правильных решений.
Результаты указывают на то, что затраты вычислений на структурированный контроль становятся все более важными по мере масштабирования агентов к более длинным запускам.