Para penulis menyajikan Intern-S2-Preview, serangkaian model dasar agentic ilmiah yang dirancang untuk mendukung pemahaman ilmiah multimodal, penalaran, generasi, dan tugas jangka panjang. Pipeline pelatihan dimulai dengan pra-pelatihan multimodal ilmiah atas dokumen ilmiah yang dirender, data gambar-teks yang diselang-seling, dan korpus ilmiah yang beragam.

  • Dimulai dari checkpoint pra-pelatihan, tim menerapkan pipeline pasca-pelatihan terpadu yang terdiri dari penyetelan halus terawasi, pembelajaran penguatan multi-tugas yang dapat diskalakan (RL), agentic RL kotak hitam dan kotak putih, dan distilasi on-policy.
  • Teknik praktis meningkatkan stabilitas rollout dan pelatihan, termasuk rollout parsial dengan koreksi off-policy, regularisasi panjang adaptif, dekode spekulatif daring, optimisasi multi-tugas yang kuat, dan perakitan pengalaman sadar jejak.
  • Intern-S2-Preview-397B memperluas pemodelan deret waktu dari pemahaman urutan panjang yang efisien ke peramalan numerik.
  • Ekstensi Memory Decoder terpisah meningkatkan skor rata-rata Biology-Instructions dari 56.92 menjadi 60.32 tanpa memodifikasi backbone 397B yang dibekukan.

Evaluasi di berbagai benchmark ilmiah, multimodal, agentic, dan tujuan umum menunjukkan bahwa Intern-S2-Preview-397B mencapai hasil kompetitif atau terdepan dalam beberapa pengaturan.