연구자들은 언어 모델이 자체 증거를 수집하도록 훈련하기 위해 2,100개 이상의 해결된 Polymarket 질문에서 파생된 에이전트 예측 환경과 데이터셋을 소개합니다. 이 시스템은 롤아웃 시 웹 검색과 금융 시계열을 통해 컨텍스트를 획득할 수 있도록 허용하며, 질문의 컷오프 전에 정보가 선행되도록 누수 필터링으로 제약됩니다.
- Qwen3.5-35B-A3B에서 브라이어 점수 보상을 사용하는 단일 에포크 GRPO로 훈련됨.
- 교정성이 30-40% 향상되고 증거 규율이 학습됨에 따라 롤아웃당 검색 시도 횟수가 3.8에서 2.25로 감소.
- 모델은 약 5%의 추론 비용으로 Claude Opus 4.5(소프트 브라이어 0.254 대 0.256)를 포함한 4개의 프론티어 모델을 능가함.
저자들은 시간 예측 에이전트를 위한 재사용 가능한 하네스로 환경, 데이터셋 및 롤아웃별 기록을 공개합니다.