शोधकर्ताओं ने एक एजेंटिक फॉरेकास्टिंग वातावरण और डेटासेट पेश किया है जो 2,100 से अधिक हल किए गए Polymarket प्रश्नों से व्युत्पन्न है ताकि भाषा मॉडलों को अपने स्वयं के सबूत इकट्ठा करने के लिए प्रशिक्षित किया जा सके। सिस्टम रोलआउट समय पर वेब खोज और वित्तीय समय श्रृंखलाओं के माध्यम से संदर्भ प्राप्त करने की एजेंट्स को अनुमति देता है, लीक फिल्टरिंग द्वारा बाधाग्रस्त ताकि जानकारी प्रश्न की कटऑफ से पहले आए।
- Qwen3.5-35B-A3B पर एकल-एपोक GRPO और बrier-स्कोर इनाम का उपयोग करके प्रशिक्षित किया गया।
- कैलिब्रेशन 30-40% से बेहतर होता है और सबूत अनुशासन सीखने के रूप में प्रति रोलआउट खोज प्रयास 3.8 से घटकर 2.25 हो जाते हैं।
- मॉडल चार फ्रंटियर मॉडल्स को पछाड़ता है, जिसमें Claude Opus 4.5 (सॉफ्ट-Brier 0.254 बनाम 0.256) शामिल है, लगभग 5% इनफरेंस लागत पर।
लेखक समय फॉरेकास्टिंग एजेंट्स के लिए एक पुनः उपयोग योग्य हार्नेस के रूप में वातावरण, डेटासेट और प्रति-रोलआउट रिकॉर्ड जारी करते हैं।