A inclusionAI lançou o modelo de código aberto Ling-3.0-flash-VL, que estende as capacidades linguísticas e de raciocínio de seu predecessor com compreensão nativa de imagens e vídeo.
O modelo de 124B parâmetros ativa apenas 5.5B parâmetros por token e suporta uma janela de contexto de até 1M tokens. Sua arquitetura apresenta um codificador visual ViT alinhado via projetor MLP, VideoRoPE para codificação temporal e um backbone híbrido alternando camadas KDA e Gated MLA.
Este design integra informações visuais no raciocínio do mundo real e fluxos de trabalho agênticos, mantendo a eficiência de inferência por meio de Mixture of Experts esparsa.