O Ling-3.0-flash-VL é um novo modelo construído na arquitetura do Ling-3.0-flash que introduz capacidades de compreensão visual e de agente visual.

O modelo tem bom desempenho em vários domínios, incluindo percepção visual, raciocínio STEM, inteligência documental, tarefas de agentes multimodais, codificação frontend e interpretação de relatórios médicos.

Este lançamento expande a utilidade do modelo base ao permitir que ele processe e interaja com dados visuais de forma eficaz.