Os autores introduzem o raciocínio meta-agêntico, um mecanismo de tempo de inferência que estrutura escolhas de execução para tarefas de longo horizonte. Um controlador gerencia o processo consolidando o progresso e despachando trabalho com base em uma conta de execução compacta em vez do histórico completo.

No ProgramBench, o raciocínio meta-alcança 71.5% com GPT-5.5 contra 58.0% para Codex, e 67.2% com Opus 4.8 contra 65.5% para Claude Code. Através de raciocínio abstrato, raciocínio de longo horizonte multi-domínio e benchmarks de geração de provas, ele ganha entre 3.6 e 4.2 pontos sobre o controle direto. A análise do grafo de artefatos mostra maior reuso do trabalho anterior e maior cobertura de soluções corretas.

Os resultados indicam que gastar computação em controle estruturado se torna cada vez mais importante à medida que os agentes escalam para execuções mais longas.