著者らは、マルチモーダルな科学的理解、推論、生成、および長期タスクをサポートするために設計された一連の科学的エージェント基盤モデルであるIntern-S2-Previewを発表する。トレーニングパイプラインは、レンダリングされた科学文書、インターリーブされた画像テキストデータ、および多様な科学コーパスにおける科学的マルチモーダル事前トレーニングから始まる。

  • 事前学習済みチェックポイントから始め、チームは教師ありファインチューニング、スケーラブルなマルチタスク強化学習(RL)、ブラックボックスおよびホワイトボックスのエージェントRL、オンポリシー蒸留で構成される統一されたポストトレーニングパイプラインを適用する。
  • ロールアウトとトレーニングの安定性を向上させる実用的な手法には、オフポリシー補正付き部分ロールアウト、適応的長さ正則化、オンライン推測デコーディング、堅牢なマルチタスク最適化、およびトレース対応経験アセンブリが含まれる。
  • Intern-S2-Preview-397Bは、効率的な長期シーケンス理解から数値予測へ時系列モデリングを拡張する。
  • 別のMemory Decoder拡張機能は、凍結された397Bバックボーンを変更せずに、Biology-Instructionsの平均スコアを56.92から60.32に向上させる。

科学、マルチモーダル、エージェント、および汎用ベンチマーク全体での評価により、Intern-S2-Preview-397Bが複数の設定で競争力のあるまたは最先端の結果を達成していることが示されている。