Para penulis memperkenalkan Stellar Colosseum, sebuah harness model-agnostik yang dirancang untuk mengalokasikan inferensi di sepanjang penelitian jangka panjang dalam matematika dan ilmu komputer teoretis. Sistem ini mengeksplorasi strategi alternatif sebelum konstruksi bukti, menggunakan gerbang kesiapan untuk menentukan kapan suatu rute cukup matang untuk dekomposisi, dan merepresentasikan rencana bukti sebagai submasalah tingkat bagian yang saling bergantung.

Colosseum menghasilkan kandidat secara paralel, menyerangnya dengan falsifikasi terarah, dan menggabungkan hasil melalui agregasi pohon sampel acak yang tumpang tindih. Terintegrasi ke dalam kerangka kerja Teamwork Google Antigravity sebagai pola Bukti Panjang, sistem ini mencapai akurasi 71.0% pada TCS-Bench menggunakan Gemini 3.1 Pro dan Gemini 3.7 Flash. Selain itu, sebuah pipa berorientasi bukti dengan umpan balik eksekusi memecahkan 218 dari 222 masalah dalam evaluasi Codeforces.

Kerangka kerja ini mengatasi ketidakandalan model bahasa pada masalah penelitian jangka panjang dengan mengelola urutan keputusan yang tidak pasti dan saling bergantung.