inclusionAI a publié le modèle open-source Ling-3.0-flash-VL, qui étend les capacités linguistiques et de raisonnement de son prédécesseur grâce à une compréhension native des images et des vidéos.

Le modèle de 124B paramètres active uniquement 5.5B paramètres par token et prend en charge une fenêtre de contexte allant jusqu'à 1M tokens. Son architecture comprend un encodeur visuel ViT aligné via un projecteur MLP, VideoRoPE pour le codage temporel, et un noyau hybride alternant des couches KDA et Gated MLA.

Cette conception intègre les informations visuelles dans le raisonnement du monde réel et les flux de travail agents, tout en maintenant l'efficacité de l'inférence grâce à un Mixture of Experts creux.