Los autores presentan Intern-S2-Preview, una serie de modelos base agenciales científicos diseñados para apoyar la comprensión científica multimodal, el razonamiento, la generación y las tareas de largo alcance. La tubería de entrenamiento comienza con un preentrenamiento multimodal científico sobre documentos científicos renderizados, datos de imagen-texto entrelazados y diversos corpus científicos.
- Partiendo del punto de control preentrenado, el equipo aplica una tubería unificada de post-entrenamiento que consiste en ajuste fino supervisado, aprendizaje por refuerzo (RL) multi-tarea escalable, RL agencial de caja negra y blanca, y destilación on-policy.
- Técnicas prácticas mejoran la estabilidad del rollout y del entrenamiento, incluyendo rollout parcial con corrección off-policy, regularización adaptativa de longitud, descodificación especulativa en línea, optimización robusta multi-tarea y ensamblaje de experiencias consciente de trazas.
- Intern-S2-Preview-397B extiende el modelado de series temporales desde la comprensión eficiente de secuencias largas hasta la predicción numérica.
- Una extensión separada del Memory Decoder mejora la puntuación promedio de Biology-Instructions de 56.92 a 60.32 sin modificar el backbone congelado de 397B.
Las evaluaciones en benchmarks científicos, multimodales, agenciales y de propósito general muestran que Intern-S2-Preview-397B logra resultados competitivos o líderes en múltiples configuraciones.