O Ling-3.0-flash-VL é um novo modelo construído na arquitetura do Ling-3.0-flash que introduz capacidades de compreensão visual e de agente visual.
O modelo tem bom desempenho em vários domínios, incluindo percepção visual, raciocínio STEM, inteligência documental, tarefas de agentes multimodais, codificação frontend e interpretação de relatórios médicos.
Este lançamento expande a utilidade do modelo base ao permitir que ele processe e interaja com dados visuais de forma eficaz.