A DeepSeek lançou um modelo experimental de compreensão visual multimodal chamado DeepSeek-V4-Flash-Vision-Exp, agora disponível na plataforma API da DeepSeek. Este novo modelo foi projetado para aprimorar as capacidades visuais enquanto mantém a paridade com sua contraparte apenas de texto.
- O modelo pode ser acessado via API definindo o parâmetro do modelo como 'deepseek-v4-flash-vision-exp'.
- Ele alcança melhorias significativas em benchmarks de agentes que exigem compreensão visual, aproximando as capacidades de agentes multimodais de Opus-4.8.
- Em termos de capacidades puramente textuais, como agente, raciocínio e conhecimento do mundo, ele tem desempenho equivalente ao DeepSeek-V4-Flash oficial.
- As pontuações dos benchmarks incluem Terminal Bench 2.1 em 83.9, Chartography em 64.3 e DSBench-Hard em 59.3.
Este lançamento fornece aos usuários uma nova ferramenta para tarefas multimodais, mantendo o desempenho textual robusto do modelo DeepSeek-V4-Flash.