著者らは、マルチモーダルな科学的理解、推論、生成、および長期タスクをサポートするために設計された一連の科学用アジェンティック基盤モデルであるIntern-S2-Previewを発表する。トレーニングパイプラインは、レンダリングされた科学文書、インターリーブされた画像テキストデータ、および多様な科学コーパスにおける科学マルチモーダル事前学習から始まる。
モデルは、教師ありファインチューニング、スケーラブルなマルチタスク強化学習(RL)、ブラックボックスおよびホワイトボックスのアジェンティックRL、オンポリシー蒸留で構成される統一されたポストトレーニングパイプラインを利用する。主な技術的改善点には、オフポリシー補正付き部分ロールアウト、適応的長さ正則化、オンライン推論デコーディング、堅牢なマルチタスク最適化、およびトレース対応経験アセンブリが含まれる。
Intern-S2-Preview-397Bは、効率的な長期シーケンス理解から数値予測まで時系列モデリングを拡張し、Memory Decoderは急速な科学的特化のための別個のメモリ拡張パスを提供する。評価により、Intern-S2-Preview-397Bが科学、マルチモーダル、アジェンティック、および汎用ベンチマークで競争力のあるまたは最先端の結果を達成していることが示された。
時系列モジュールはSciTSにおける科学的信号の理解と予測を改善し、別個のIntern-MemDec-4B拡張は、凍結された397Bバックボーンを変更せずに、Biology-Instructionsの平均スコアを56.92から60.32に向上させる。