inclusionAI выпустила модель с открытым исходным кодом Ling-3.0-flash-VL, которая расширяет языковые и рассуждающие способности своего предшественника за счёт нативного понимания изображений и видео.
Модель на 124B параметров активирует только 5.5B параметров на токен и поддерживает контекстное окно до 1M токенов. Её архитектура включает визуальный энкодер ViT, выровненный через проектор MLP, VideoRoPE для временного кодирования и гибридное ядро с чередующимися слоями KDA и Gated MLA.
Эта конструкция интегрирует визуальную информацию в рассуждения реального мира и агентные рабочие процессы, сохраняя при этом эффективность вывода за счёт разреженного Mixture of Experts.