A DeepSeek lançou oficialmente o modelo DeepSeek V4.1 Flash, a entrada mais pequena da sua nova série de arquiteturas que apresenta compreensão visual multimodal nativa. Construído sobre um design Causal-Encoder-Decoder, é um modelo Mixture of Experts (MoE) de 552B parâmetros que ativa apenas 8B parâmetros no lado de entrada e 16B no lado de saída.

  • A arquitetura assimétrica reduz significativamente os custos de inferência em comparação com modelos conhecidos do mesmo tamanho.
  • A compressão do cache KV reduz os requisitos de HBM para 1/4 e os requisitos de SSD para 1/8 da geração anterior, diminuindo os custos para tarefas do tipo agente.
  • Testes de benchmark mostram que o V4.1 Flash supera o nível de inteligência de modelos principais, incluindo o DeepSeek V4 Pro.
  • O modelo está agora ativo na API da DeepSeek sob o nome `deepseek-flash`, com as variantes mais antigas do V4 Flash redirecionadas para ele temporariamente.
  • A precificação foi ajustada com taxas de pico e fora de pico, e os pedidos para `deepseek-v4-pro` serão redirecionados para o V4.1 Flash após 14 de setembro de 2026.

A nova arquitetura visa proporcionar um teto de capacidade mais elevado, inferência mais rápida, maior throughput e escalabilidade para modelos de parâmetros maiores, ao mesmo tempo que serve mais utilizadores com menor custo.