著者らは、Stellar Colosseumを発表しました。これは、数学および理論計算機科学における長期の研究課題に対して推論を割り当てるために設計されたモデル非依存のハーンです。このシステムは証明構築の前に代替戦略を検索し、準備ゲートを使用して分解するタイミングを決定し、証明計画を相互依存的な部分問題として表現します。

Colosseumは候補を並列で生成し、ターゲットを絞った反証によってそれらに攻撃し、重複するランダムサンプリングツリー集約を通じて結果を統合します。このワークフローは、Long ProofパターンとしてGoogle AntigravityのTeamworkフレームワークに統合されています。TCS-Benchでの評価では、Gemini 3.1 ProおよびGemini 3.7 Flashを使用して71.0%の精度を達成しました。さらに、実行フィードバック付きの証明指向パイプラインにより、222問中218問のCodeforces問題を解決しました。

このハーンは、構造化された検証と集約を通じて不確実な意思決定のシーケンスを管理することで、複雑な研究タスクにおける言語モデルの信頼性の低さを解消します。