inclusionAI выпустила модель с открытым исходным кодом Ling-3.0-flash-VL, которая расширяет языковые и рассуждающие способности своего предшественника за счёт нативного понимания изображений и видео.

Модель на 124B параметров активирует только 5.5B параметров на токен и поддерживает контекстное окно до 1M токенов. Её архитектура включает визуальный энкодер ViT, выровненный через проектор MLP, VideoRoPE для временного кодирования и гибридное ядро с чередующимися слоями KDA и Gated MLA.

Эта конструкция интегрирует визуальную информацию в рассуждения реального мира и агентные рабочие процессы, сохраняя при этом эффективность вывода за счёт разреженного Mixture of Experts.