Les chercheurs présentent un environnement et un jeu de données de prévision basés sur des agents dérivés de plus de 2 100 questions résolues de Polymarket pour entraîner les modèles de langage à rassembler leurs propres preuves. Le système permet aux agents d'acquérir du contexte via une recherche web et des séries temporelles financières au moment du déploiement, avec un filtrage des fuites pour garantir que l'information précède la date limite de la question.

  • Entraîné sur Qwen3.5-35B-A3B en utilisant GRPO à une seule époque avec une récompense basée sur le score de Brier.
  • La calibration s'améliore de 30 à 40 % et les tentatives de recherche diminuent de 3,8 à 2,25 par déploiement à mesure que la discipline des preuves est apprise.
  • Le modèle surpasse quatre modèles de pointe, dont Claude Opus 4.5 (Brier doux 0,254 contre 0,256), pour environ 5 % du coût d'inférence.

Les auteurs publient l'environnement, le jeu de données et les enregistrements par déploiement comme un harnais réutilisable pour les agents de prévision temporelle.