Stellar Colosseum adalah harness model-agnostik yang dirancang untuk mengalokasikan inferensi pada penelitian jangka panjang di bidang matematika dan ilmu komputer teoretis, mengatasi ketidakandalan model bahasa dalam menangani masalah kompleks. Sistem ini mengeksplorasi strategi alternatif sebelum konstruksi bukti, menggunakan gerbang kesiapan untuk menentukan kapan suatu rute cukup matang untuk dekomposisi, serta merepresentasikan rencana bukti sebagai submasalah tingkat bagian yang saling bergantung.

  • Colosseum menghasilkan kandidat secara paralel, menyerangnya dengan falsifikasi terarah, dan menggabungkan hasil melalui agregasi pohon sampel acak yang tumpang tindih.
  • Alur kerja ini diintegrasikan ke dalam framework Teamwork Google Antigravity sebagai pola Long Proof.
  • Pada TCS-Bench, sebuah benchmark tugas pembuktian teorema tingkat penelitian dari makalah FOCS, STOC, dan SODA, Colosseum mencapai akurasi 71.0% menggunakan Gemini 3.1 Pro dan Gemini 3.7 Flash.
  • Dalam evaluasi Codeforces dengan Gemini 3.1 Pro, alur kerja berorientasi bukti dengan umpan balik eksekusi menyelesaikan 218 dari 222 masalah.

Para penulis menunjukkan bahwa pendekatan ini mengatasi masalah terbuka dari venue terkemuka seperti FOCS dan JMLR melalui penelitian terbuka dan evaluasi benchmark.