inclusionAI ha lanzado el modelo de código abierto Ling-3.0-flash-VL, que extiende las capacidades lingüísticas y de razonamiento de su predecesor con comprensión nativa de imágenes y video.
El modelo de 124B parámetros activa solo 5.5B parámetros por token y admite una ventana de contexto de hasta 1M tokens. Su arquitectura cuenta con un codificador visual ViT alineado mediante un proyector MLP, VideoRoPE para codificación temporal y un núcleo híbrido que alterna capas KDA y Gated MLA.
Este diseño integra información visual en el razonamiento del mundo real y flujos de trabajo agénticos, manteniendo la eficiencia de inferencia a través de una Mezcla Esparsa de Expertos.