研究人员引入了一种基于智能体的预测环境和数据集,该数据集源自超过2100个已解决的Polymarket问题,用于训练语言模型收集自身的证据。该系统允许智能体在 rollout 时通过网页搜索和金融时间序列获取上下文,并通过泄漏过滤进行约束,以确保信息早于问题的截止时间。

  • 使用单轮 GRPO 和 Brier 分数奖励在 Qwen3.5-35B-A3B 上进行训练。
  • 校准度提高 30-40%,随着证据纪律的学习,每次 rollout 的搜索尝试次数从 3.8 次减少到 2.25 次。
  • 该模型以约 5% 的推理成本超越了包括 Claude Opus 4.5(软 Brier 分数 0.254 vs 0.256)在内的四个前沿模型。

作者发布了该环境、数据集以及每次 rollout 的记录,作为时间预测智能体的可重用框架。