Les auteurs présentent Intern-S2-Preview, une série de modèles fondamentaux scientifiques agentiques conçus pour soutenir la compréhension scientifique multimodale, le raisonnement, la génération et les tâches à long terme. Le pipeline d'entraînement commence par un pré-entraînement multimodal scientifique sur des documents scientifiques rendus, des données image-texte entrelacées et divers corpus scientifiques.
- À partir du checkpoint pré-entraîné, l'équipe applique un pipeline post-entraînement unifié composé de réglage fin supervisé, d'apprentissage par renforcement multi-tâches évolutif (RL), de RL agentique en boîte noire et blanche, et de distillation on-policy.
- Des techniques pratiques améliorent la stabilité du rollout et de l'entraînement, y compris le rollout partiel avec correction off-policy, la régularisation adaptative de longueur, le décodage spéculatif en ligne, l'optimisation robuste multi-tâches et l'assemblage d'expérience conscient des traces.
- Intern-S2-Preview-397B étend la modélisation des séries temporelles de la compréhension efficace de longues séquences à la prévision numérique.
- Une extension séparée du Décodeur de Mémoire améliore le score moyen Biology-Instructions de 56,92 à 60,32 sans modifier le noyau gelé de 397B.
Les évaluations sur des benchmarks scientifiques, multimodaux, agentiques et à usage général montrent que Intern-S2-Preview-397B atteint des résultats compétitifs ou de pointe dans de multiples configurations.