InternLM a présenté Intern-S2-397B, un modèle fondamental multimodal de 397 milliards de paramètres conçu pour l'intelligence scientifique et les agents à long terme. Le modèle s'étend sur le pré-entraînement, la couverture des tâches d'apprentissage par renforcement et les environnements d'agents interactifs afin d'améliorer le raisonnement général et les capacités agentic.
- Nouveau paradigme de pré-entraînement : Intern-S2-397B apprend directement à partir de pages brutes de littérature scientifique, modélisant conjointement la sémantique symbolique et les relations visuelles sans analyse intermédiaire pour préserver la correspondance texte-visuel.
- Raisonnement modalité scientifique : En étendant diverses tâches d'apprentissage par renforcement scientifiques sur plus de 20 domaines, le modèle atteint des performances de raisonnement général parmi les meilleures pour les modèles open-source.
- Agents à long terme : Le modèle connecte plusieurs frameworks d'agents à des environnements sandboxisés à grande échelle pour l'apprentissage par renforcement agentic en boîte noire, améliorant la généralisation dans les tâches à long terme.
Cette publication vise à offrir un saut qualitatif dans la résolution de problèmes scientifiques et le plafond de capacité pour les tâches à long terme tant dans les domaines généraux que scientifiques.