Stellar Colosseum은 모델 독립적 하네스로, 복잡한 문제에서 언어 모델의 신뢰성 부족 문제를 해결하며 수학 및 이론 컴퓨터 과학 분야의 장기 연구 전반에 추론 작업을 분배하도록 설계되었습니다. 이 시스템은 증명 구성 전에 대체 전략을 탐색하고, 준비 게이트를 통해 경로가 분해에 충분히 성숙했는지 판단하며, 증명 계획을 상호 의존적인 섹션 수준의 하위 문제로 표현합니다.
- Colosseum은 병렬로 후보를 생성하고 표적화된 반증으로 이를 공격하며, 겹치는 랜덤 샘플 트리 집계 방식을 통해 결과를 결합합니다.
- 이 워크플로는 Google Antigravity의 Teamwork 프레임워크에 Long Proof 패턴으로 통합되었습니다.
- FOCS, STOC, SODA 논문에서 발췌한 연구 수준 정리 증명 작업을 평가하는 벤치마크인 TCS-Bench에서 Colosseum은 Gemini 3.1 Pro와 Gemini 3.7 Flash를 사용해 71.0%의 정확도를 달성했습니다.
- Gemini 3.1 Pro를 사용한 Codeforces 평가에서 실행 피드백이 포함된 증명 중심 파이프라인은 222문제 중 218문제를 해결했습니다.
저자들은 이 접근 방식이 FOCS와 JMLR 같은 최상위 학술지에서 다루는 미해결 문제를 개방형 연구 및 벤치마크 평가를 통해 해결할 수 있음을 입증했습니다.