Stellar Colosseum es un harness agnóstico al modelo diseñado para distribuir la inferencia en investigaciones de largo alcance en matemáticas y ciencias teóricas de la computación, abordando la falta de fiabilidad de los modelos de lenguaje en problemas complejos. El sistema explora estrategias alternativas antes de la construcción de pruebas, utiliza un gate de preparación para determinar cuándo una ruta está lo suficientemente madura para la descomposición, y representa el plan de prueba como subproblemas interdependientes a nivel de sección.
- Colosseum genera candidatos en paralelo, los ataca con falsificación dirigida y combina resultados mediante agregación de árboles de muestreo aleatorio superpuestos.
- El flujo de trabajo está integrado en el framework Teamwork de Google Antigravity como el patrón Long Proof.
- En TCS-Bench, un benchmark de tareas de demostración de teoremas a nivel de investigación de los artículos de FOCS, STOC y SODA, Colosseum alcanza una precisión del 71.0% utilizando Gemini 3.1 Pro y Gemini 3.7 Flash.
- En una evaluación de Codeforces con Gemini 3.1 Pro, el pipeline orientado a pruebas con retroalimentación de ejecución resuelve 218 de los 222 problemas.
Los autores demuestran que este enfoque aborda problemas abiertos de conferencias de primer nivel como FOCS y JMLR mediante investigación abierta y evaluaciones de benchmark.