Para peneliti memperkenalkan lingkungan dan dataset peramalan berbasis agen yang berasal dari lebih dari 2.100 pertanyaan Polymarket yang telah diselesaikan untuk melatih model bahasa mengumpulkan bukti mereka sendiri. Sistem memungkinkan agen memperoleh konteks melalui pencarian web dan deret waktu keuangan pada saat rollout, dibatasi oleh filter kebocoran untuk memastikan informasi mendahului batas waktu pertanyaan.

  • Dilatih pada Qwen3.5-35B-A3B menggunakan GRPO satu epoch dengan reward skor Brier.
  • Kalibrasi meningkat sebesar 30-40% dan upaya pencarian menurun dari 3,8 menjadi 2,25 per rollout seiring pembelajaran disiplin bukti.
  • Model ini mengungguli empat model terdepan, termasuk Claude Opus 4.5 (Brier lunak 0,254 vs 0,256), dengan biaya inferensi sekitar 5%.

Para penulis merilis lingkungan, dataset, dan catatan per-rollout sebagai harness yang dapat digunakan kembali untuk agen peramalan temporal.