Os autores apresentam o Intern-S2-Preview, uma série de modelos de base agênicos científicos projetados para apoiar a compreensão multimodal científica, raciocínio, geração e tarefas de longo prazo. O pipeline de treinamento começa com o pré-treinamento multimodal científico sobre documentos científicos renderizados, dados de imagem-texto intercalados e corpora científicos diversos.

O modelo utiliza um pipeline unificado de pós-treinamento consistindo em ajuste fino supervisionado, aprendizado por reforço multi-tarefa escalável (RL), RL agênico de caixa preta e branca, e destilação on-policy. As principais melhorias técnicas incluem rollout parcial com correção off-policy, regularização adaptativa de comprimento, decodificação especulativa online, otimização robusta multi-tarefa e montagem de experiência consciente do traço.

O Intern-S2-Preview-397B estende o modelamento de séries temporais da compreensão eficiente de sequências longas para a previsão numérica, enquanto o Memory Decoder fornece um caminho separado aumentado por memória para especialização científica rápida. As avaliações mostram que o Intern-S2-Preview-397B alcança resultados competitivos ou líderes em benchmarks científicos, multimodais, agênicos e de propósito geral.

Os módulos de séries temporais melhoram a compreensão do sinal científico e a previsão no SciTS, enquanto a extensão separada Intern-MemDec-4B melhora a pontuação média do Biology-Instructions de 56.92 para 60.32 sem modificar o backbone congelado de 397B.