Les auteurs introduisent le raisonnement méta-agents, un harnais d'inférence qui structure les choix d'exécution pour des tâches à long horizon. Un contrôleur gère le processus en consolidant les progrès et en distribuant le travail sur la base d'un compte d'exécution compact plutôt que de l'historique complet.

Sur ProgramBench, le raisonnement méta-atteint 71.5% avec GPT-5.5 contre 58.0% pour Codex, et 67.2% avec Opus 4.8 contre 65.5% pour Claude Code. À travers le raisonnement abstrait, le raisonnement à long horizon multi-domaine et les benchmarks de génération de preuves, il gagne entre 3.6 et 4.2 points par rapport au contrôle direct. L'analyse du graphe d'artefacts montre une réutilisation accrue du travail antérieur et une couverture plus élevée des solutions correctes.

Les résultats indiquent que dépenser du calcul sur un contrôle structuré devient de plus en plus important à mesure que les agents passent à des exécutions plus longues.