Los autores presentan el razonamiento meta-agente, un mecanismo de tiempo de inferencia que estructura las elecciones de ejecución para tareas de largo horizonte. Un controlador gestiona el proceso consolidando el progreso y distribuyendo el trabajo basado en una cuenta de ejecución compacta en lugar del historial completo.
En ProgramBench, el razonamiento meta-alcanza 71.5% con GPT-5.5 contra 58.0% para Codex, y 67.2% con Opus 4.8 contra 65.5% para Claude Code. A través de razonamiento abstracto, razonamiento de largo horizonte multi-dominio y benchmarks de generación de pruebas, gana entre 3.6 y 4.2 puntos sobre el control directo. El análisis del grafo de artefactos muestra un mayor reuso del trabajo anterior y una cobertura más alta de soluciones correctas.
Los resultados indican que gastar computación en control estructurado se vuelve cada vez más importante a medida que los agentes escalan a ejecuciones más largas.