أطلقت inclusionAI نموذج المصدر المفتوح Ling-3.0-flash-VL، الذي يوسع قدرات اللغة والاستدلال لسلفه من خلال الفهم الأصلي للصور والفيديو.

يُفعّل النموذج ذو الـ 124B معلمة فقط 5.5B معلمة لكل توكن ويدعم نافذة سياق تصل إلى 1M توكن. تتميز هندسته بمُشفّر مرئي ViT مُحاذاً عبر مُسقط MLP، وVideoRoPE للتشفير الزمني، ونواة هجينة تتناوب بين طبقات KDA وGated MLA.

يُدمج هذا التصميم المعلومات المرئية في الاستدلال الواقعي وسير العمل الوكيلِي مع الحفاظ على كفاءة الاستنتاج من خلال Mixture of Experts المتفرقة.