InternLM ha presentado Intern-S2-397B, un modelo base multimodal de 397 mil millones de parámetros diseñado para la inteligencia científica y agentes de horizonte largo. El modelo escala en preentrenamiento, cobertura de tareas de aprendizaje por refuerzo y entornos de agentes interactivos para mejorar el razonamiento general y las capacidades agénticas.
- Nuevo Paradigma de Preentrenamiento: Intern-S2-397B aprende directamente de páginas crudas de literatura científica, modelando conjuntamente la semántica simbólica y las relaciones visuales sin análisis intermedio para preservar la correspondencia texto-visual.
- Razonamiento de Modalidad Científica: Al escalar diversas tareas de aprendizaje por refuerzo científico en más de 20 dominios, el modelo logra un rendimiento destacado en razonamiento general entre los modelos de código abierto.
- Agentes de Horizonte Largo: El modelo conecta múltiples marcos de agentes con entornos sandboxed a gran escala para aprendizaje por refuerzo agéntico de caja negra, mejorando la generalización en tareas de horizonte largo.
Este lanzamiento tiene como objetivo ofrecer un cambio significativo en la resolución de problemas científicos y el techo de capacidades para tareas de horizonte largo tanto en dominios generales como científicos.