研究者たちは、言語モデルが独自の証拠を集めるように訓練するための、2,100以上の解決されたPolymarketの質問から派生したエージェント型予測環境とデータセットを導入しました。このシステムは、ロールアウト時にウェブ検索と金融時系列を通じてコンテキストを取得することをエージェントに許可し、質問の cutoff より前に情報が来ることを保証するためにリークフィルタリングで制約されます。
- Qwen3.5-35B-A3B上で、ブライアスコア報酬を用いた単一エポックのGRPOで訓練。
- 較正が30-40%改善し、証拠の規律が学ばれるにつれて、ロールアウトあたりの検索試行回数は3.8から2.25に減少。
- モデルは推論コストの約5%で、Claude Opus 4.5(ソフト-Brier 0.254 vs 0.256)を含む4つの最先端モデルを上回る。
著者たちは、時間予測エージェントのための再利用可能なハーネスとして、環境、データセット、およびロールアウトごとのレコードを公開します。