Os autores apresentam o Stellar Colosseum, um harness agnóstico a modelos projetado para alocar inferência em problemas de pesquisa de longo prazo em matemática e ciência da computação teórica. O sistema explora estratégias alternativas antes da construção da prova, utiliza um gate de prontidão para determinar quando decompor rotas e representa planos de prova como subproblemas interdependentes.
O Colosseum gera candidatos em paralelo, ataca-os com falsificação direcionada e combina resultados por meio de agregação em árvore de amostragem aleatória sobreposta. Este fluxo de trabalho é integrado ao framework Teamwork do Google Antigravity como o padrão Long Proof. Avaliações no TCS-Bench mostram 71,0% de precisão usando Gemini 3.1 Pro e Gemini 3.7 Flash. Além disso, um pipeline orientado a provas com feedback de execução resolveu 218 dos 222 problemas do Codeforces.
O harness aborda a não confiabilidade de modelos de linguagem em tarefas complexas de pesquisa, gerenciando sequências de decisões incertas por meio de verificação e agregação estruturadas.