inclusionAI telah merilis model open-source Ling-3.0-flash-VL, yang memperluas kemampuan bahasa dan penalaran pendahulunya dengan pemahaman gambar dan video secara native.
Model 124B parameter ini hanya mengaktifkan 5.5B parameter per token dan mendukung jendela konteks hingga 1M token. Arsitekturnya mencakup encoder visual ViT yang diluruskan melalui projector MLP, VideoRoPE untuk pengodean temporal, dan backbone hibrida yang bergantian antara lapisan KDA dan Gated MLA.
Desain ini mengintegrasikan informasi visual ke dalam penalaran dunia nyata dan alur kerja agentic sambil mempertahankan efisiensi inferensi melalui Mixture of Experts yang sparse.