Stellar Colosseum 是一个与模型无关的框架,旨在为数学和理论计算机科学领域的长周期研究分配推理资源,以解决语言模型在处理复杂问题时可靠性不足的问题。该系统在构建证明之前探索替代策略,使用就绪门控(readiness gate)判断某条路径是否足够成熟以进行分解,并将证明计划表示为相互依赖的章节级子问题。
- Colosseum 并行生成候选方案,通过定向证伪对其进行攻击,并通过重叠的随机采样树聚合来整合结果。
- 该工作流已集成到 Google Antigravity 的 Teamwork 框架中,作为 Long Proof 模式。
- 在 TCS-Bench(一项源自 FOCS、STOC 和 SODA 论文的研究级定理证明任务基准)上,Colosseum 使用 Gemini 3.1 Pro 和 Gemini 3.7 Flash 达到了 71.0% 的准确率。
- 在与 Gemini 3.1 Pro 进行的 Codeforces 评估中,带有执行反馈的证明导向流水线解决了 222 个问题中的 218 个。
作者表明,该方法通过开放式研究和基准评估解决了 FOCS 和 JMLR 等顶级会议/期刊中的开放问题。