inclusionAI는 네이티브 이미지 및 비디오 이해 기능을 통해 전작의 언어 및 추론 능력을 확장한 오픈소스 Ling-3.0-flash-VL 모델을 출시했습니다.

124B 파라미터 모델은 토큰당 5.5B 파라미터만 활성화하며 최대 1M 토큰의 컨텍스트 윈도우를 지원합니다. 이 아키텍처는 MLP 프로젝터를 통해 정렬된 ViT 시각 인코더, 시간 인코딩을 위한 VideoRoPE, 그리고 KDA와 Gated MLA 레이어를 교대로 사용하는 하이브리드 백본을 특징으로 합니다.

이 설계는 희소 Mixture of Experts를 통한 추론 효율성을 유지하면서 현실 세계의 추론 및 에이전트 워크플로우에 시각 정보를 통합합니다.