Исследователи представляют агентную среду прогнозирования и набор данных, созданный на основе более чем 2100 разрешенных вопросов Polymarket, для обучения языковых моделей собирать собственные доказательства. Система позволяет агентам получать контекст через веб-поиск и финансовые временные ряды во время развертывания, с ограничением фильтрации утечек, чтобы обеспечить предварение информации до момента отсечения вопроса.
- Обучена на Qwen3.5-35B-A3B с использованием одноэпохового GRPO с вознаграждением по критерию Брайера.
- Калибровка улучшается на 30-40%, а количество попыток поиска снижается с 3,8 до 2,25 за развертывание, поскольку дисциплина доказательств усваивается.
- Модель превосходит четыре передовые модели, включая Claude Opus 4.5 (мягкий критерий Брайера 0,254 против 0,256), примерно при 5% стоимости вывода.
Авторы публикуют среду, набор данных и записи за каждое развертывание как повторно используемый каркас для агентов временного прогнозирования.