Os pesquisadores apresentam um ambiente e conjunto de dados de previsão baseados em agentes derivados de mais de 2.100 perguntas resolvidas do Polymarket para treinar modelos de linguagem a reunir suas próprias evidências. O sistema permite que os agentes adquiram contexto por meio de pesquisa na web e séries temporais financeiras no momento da rollout, com restrição de filtragem de vazamento para garantir que a informação preceda o corte da pergunta.

  • Treinado no Qwen3.5-35B-A3B usando GRPO de uma única época com recompensa baseada no escore de Brier.
  • A calibração melhora em 30-40% e as tentativas de pesquisa diminuem de 3,8 para 2,25 por rollout à medida que a disciplina de evidências é aprendida.
  • O modelo supera quatro modelos de ponta, incluindo Claude Opus 4.5 (Brier suave 0,254 vs 0,256), por aproximadamente 5% do custo de inferência.

Os autores lançam o ambiente, o conjunto de dados e os registros por rollout como uma estrutura reutilizável para agentes de previsão temporal.