लेखकों ने Intern-S2-Preview प्रस्तुत किया, जो बहुआयामी वैज्ञानिक समझ, तर्क, उत्पादन और दीर्घकालिक कार्यों का समर्थन करने के लिए डिज़ाइन किए गए वैज्ञानिक एजेंटिक फाउंडेशन मॉडल की एक श्रृंखला है। प्रशिक्षण पाइपलाइन रेंडर किए गए वैज्ञानिक दस्तावेज़ों, इंटरलीव्ड इमेज-टेक्स्ट डेटा और विविध वैज्ञानिक कॉर्परा पर वैज्ञानिक बहुआयामी पूर्व-प्रशिक्षण के साथ शुरू होती है।
- पूर्व-प्रशिक्षित चेकपॉइंट से शुरू करते हुए, टीम में निगरानी फाइन-ट्यूनिंग, स्केलेबल मल्टी-टास्क रिनफोर्समेंट लर्निंग (RL), ब्लैक- और व्हाइट-बॉक्स एजेंटिक RL, और ऑन-पॉलिसी डिस्टिलेशन से मिलकर एक एकीकृत पोस्ट-ट्रेनिंग पाइपलाइन लागू करती है।
- रोलआउट और प्रशिक्षण स्थिरता में सुधार करने के लिए व्यावहारिक तकनीकों का उपयोग किया जाता है, जिसमें ऑफ-पॉलिसी सुधार के साथ आंशिक रोलआउट, अनुकूली लंबाई नियमितीकरण, ऑनलाइन स्पेकुलेटिव डिकोडिंग, मजबूत मल्टी-टास्क ऑप्टिमाइज़ेशन और ट्रैस-अवेयर एक्सपीरियंस असेंबली शामिल हैं।
- Intern-S2-Preview-397B समय श्रृंखला मॉडलिंग को कुशल दीर्घ-क्रम समझ से संख्यात्मक पूर्वानुमान तक विस्तारित करता है।
- एक अलग मेमोरी डिकोडर एक्सटेंशन ने फ्रोज़न 397B बैकबोन में कोई बदलाव किए बिना Biology-Instructions औसत स्कोर को 56.92 से बढ़ाकर 60.32 कर दिया।
वैज्ञानिक, बहुआयामी, एजेंटिक और सामान्य उद्देश्य वाले बेंचमार्क्स पर किए गए मूल्यांकन दिखाते हैं कि Intern-S2-Preview-397B कई सेटिंग्स में प्रतिस्पर्धी या अग्रणी परिणाम प्राप्त करता है।