著者らは、Stellar Colosseumを提案する。これは、数学および理論計算機科学における長期ホリズンの研究に対して推論を割り当てるために設計されたモデル非依存のハーネスである。本システムは、証明構築の前に代替戦略を検索し、準備状態ゲートを使用して分解に適したルートが成熟したかどうかを判断し、証明計画を相互依存的なセクションレベルの部分問題として表現する。

Colosseumは候補を並列に生成し、ターゲットを絞った反証によってそれらを検証し、重複するランダムサンプリングツリー集約を通じて結果を統合する。Google AntigravityのTeamworkフレームワークにLong Proofパターンとして統合され、Gemini 3.1 ProおよびGemini 3.7 Flashを使用してTCS-Benchで71.0%の精度を達成した。さらに、実行フィードバック付きの証明指向パイプラインは、Codeforces評価において222問中218問を解決した。

本フレームワークは、長期ホリズンの研究問題における言語モデルの信頼性の低さを、不確実で相互依存的な意思決定のシーケンスを管理することで解消する。