저자들은 Intern-S2-Preview를 제시하는데, 이는 멀티모달 과학적 이해, 추론, 생성 및 장기 작업을 지원하도록 설계된 일련의 과학용 에이전트 파운데이션 모델입니다. 훈련 파이프라인은 렌더링된 과학 문서, 교차된 이미지-텍스트 데이터 및 다양한 과학 코퍼스를 대상으로 한 과학 멀티모달 사전 훈련으로 시작됩니다.
- 사전 훈련된 체크포인트에서 팀은 지도 미세 조정, 확장 가능한 다중 작업 강화 학습(RL), 블랙박스 및 화이트박스 에이전트 RL, 온-정책 디스틸레이션으로 구성된 통합 사후 훈련 파이프라인을 적용합니다.
- 오프-정책 보정이 있는 부분 롤아웃, 적응형 길이 정규화, 온라인 추측 디코딩, 견고한 다중 작업 최적화 및 추적 인식 경험 조립을 포함한 실용적 기법들이 롤아웃과 훈련 안정성을 개선합니다.
- Intern-S2-Preview-397B는 효율적인 장문 시퀀스 이해에서 수치 예측으로 시간 계열 모델링을 확장합니다.
- 별도의 Memory Decoder 확장은 동결된 397B 백본을 수정하지 않고도 Biology-Instructions 평균 점수를 56.92에서 60.32로 향상시킵니다.
과학, 멀티모달, 에이전트 및 범용 벤치마크에 걸친 평가는 Intern-S2-Preview-397B가 여러 설정에서 경쟁력 있거나 선도적인 결과를 달성함을 보여줍니다.