Stellar Colosseumは、数学および理論計算機科学における長期の研究に対して推論を割り当てるために設計されたモデル非依存のハーンであり、複雑な問題に対する言語モデルの信頼性の低さに対処する。このシステムは証明構築の前に代替戦略を探査し、準備状態ゲートを使用してルートが分解に十分な成熟度を持っているかを判断し、証明計画を相互依存的なセクションレベルのサブ問題として表現する。
- Colosseumは候補を並列で生成し、ターゲット化された反証でそれらを検証し、重複するランダムサンプリングツリー集約を通じて結果を統合する。
- ワークフローはGoogle AntigravityのTeamworkフレームワークにLong Proofパターンとして統合されている。
- FOCS、STOC、SODAの論文からの研究レベルの定理証明タスクからなるベンチマークであるTCS-Benchにおいて、ColosseumはGemini 3.1 ProおよびGemini 3.7 Flashを使用して71.0%の精度を達成する。
- Gemini 3.1 Proを用いたCodeforces評価では、実行フィードバック付きの証明指向パイプラインが222問中218問を解決する。
著者たちは、このアプローチがFOCSやJMLRといったトップカンファレンスの未解決問題に、オープンエンドの研究およびベンチマーク評価を通じて対処できることを実証している。