Los autores presentan Stellar Colosseum, un harness agnóstico al modelo diseñado para distribuir la inferencia entre problemas de investigación a largo plazo en matemáticas y ciencias de la computación teórica. El sistema explora estrategias alternativas antes de la construcción de pruebas, utiliza un filtro de preparación para determinar cuándo descomponer las rutas y representa los planes de prueba como subproblemas interdependientes.
Colosseum genera candidatos en paralelo, los ataca con falsificación dirigida y combina resultados mediante agregación de árboles de muestreo aleatorio superpuestos. Este flujo de trabajo se integra en el framework Teamwork de Google Antigravity como el patrón Long Proof. Las evaluaciones en TCS-Bench muestran una precisión del 71,0% utilizando Gemini 3.1 Pro y Gemini 3.7 Flash. Además, un pipeline orientado a pruebas con retroalimentación de ejecución resolvió 218 de los 222 problemas de Codeforces.
El harness aborda la falta de fiabilidad de los modelos de lenguaje en tareas de investigación complejas mediante la gestión de secuencias de decisiones inciertas a través de verificación y agregación estructuradas.