Para penulis memperkenalkan Stellar Colosseum, sebuah harness yang model-agnostik yang dirancang untuk mengalokasikan inferensi pada masalah penelitian jangka panjang dalam bidang matematika dan ilmu komputer teoretis. Sistem ini mengeksplorasi strategi alternatif sebelum konstruksi bukti, menggunakan gerbang kesiapan untuk menentukan kapan harus mendekomposisi rute, dan merepresentasikan rencana bukti sebagai submasalah yang saling bergantung.
Colosseum menghasilkan kandidat secara paralel, menyerangnya dengan falsifikasi terarah, dan menggabungkan hasil melalui agregasi pohon sampel acak yang tumpang tindih. Alur kerja ini diintegrasikan ke dalam framework Teamwork Google Antigravity sebagai pola Long Proof. Evaluasi pada TCS-Bench menunjukkan akurasi 71.0% menggunakan Gemini 3.1 Pro dan Gemini 3.7 Flash. Selain itu, sebuah pipeline berorientasi bukti dengan umpan balik eksekusi berhasil menyelesaikan 218 dari 222 masalah Codeforces.
Harness ini mengatasi ketidakandalan model bahasa pada tugas penelitian kompleks dengan mengelola urutan keputusan yang tidak pasti melalui verifikasi terstruktur dan agregasi.