Os autores apresentam o Intern-S2-Preview, uma série de modelos de base agênicos científicos projetados para apoiar a compreensão multimodal científica, raciocínio, geração e tarefas de longo prazo. O pipeline de treinamento começa com o pré-treinamento multimodal científico sobre documentos científicos renderizados, dados de imagem-texto intercalados e corpora científicos diversos.

  • A partir do checkpoint pré-treinado, a equipe aplica um pipeline unificado de pós-treinamento consistindo em ajuste fino supervisionado, aprendizado por reforço multi-tarefa escalável (RL), RL agênico de caixa preta e branca, e destilação on-policy.
  • Técnicas práticas melhoram a estabilidade do rollout e do treinamento, incluindo rollout parcial com correção off-policy, regularização adaptativa de comprimento, decodificação especulativa online, otimização multi-tarefa robusta e montagem de experiência consciente de traços.
  • O Intern-S2-Preview-397B estende o modelamento de séries temporais da compreensão eficiente de sequências longas para a previsão numérica.
  • Uma extensão separada do Memory Decoder melhora a pontuação média do Biology-Instructions de 56.92 para 60.32 sem modificar o backbone congelado de 397B.

Avaliações em benchmarks científicos, multimodais, agênicos e de propósito geral mostram que o Intern-S2-Preview-397B alcança resultados competitivos ou líderes em múltiplos cenários.