Los investigadores presentan un entorno y conjunto de datos de pronóstico basado en agentes derivados de más de 2.100 preguntas resueltas de Polymarket para entrenar modelos de lenguaje a recopilar sus propias evidencias. El sistema permite a los agentes adquirir contexto mediante búsqueda web y series temporales financieras en el momento del despliegue, con un filtro de filtración para asegurar que la información preceda al corte de la pregunta.

  • Entrenado en Qwen3.5-35B-A3B usando GRPO de una sola época con recompensa basada en el puntaje de Brier.
  • La calibración mejora entre un 30% y 40%, y los intentos de búsqueda disminuyen de 3,8 a 2,25 por despliegue a medida que se aprende la disciplina de evidencia.
  • El modelo supera a cuatro modelos líderes, incluyendo Claude Opus 4.5 (Brier suave 0,254 frente a 0,256), con aproximadamente el 5% del costo de inferencia.

Los autores publican el entorno, el conjunto de datos y los registros por despliegue como un arnés reutilizable para agentes de pronóstico temporal.