A DeepSeek lançou a API DeepSeek-V4-Flash em beta público e imediatamente disponibilizou seus pesos sob uma licença MIT. A atualização oferece melhorias substanciais de desempenho em relação à prévia de abril, sem alterar a arquitetura ou o tamanho do modelo, posicionando-se como uma alternativa econômica aos modelos proprietários.

  • A API Flash supera o V4-Pro-Preview em capacidades de agente e suporta o formato da Responses API.
  • As pontuações no Terminal-Bench saltaram de 56,9 para 82,7, enquanto o Elo do GDPval-AA subiu de 1189 para 1559.
  • O modelo mantém sua contagem total de 284B / 13B parâmetros ativos e janela de contexto de 1M.
  • A precificação está definida em $0,14/$0,28 por 1M tokens, com um desconto de 98% para cache-hit, reduzindo os custos de cache para $0,0028/1M.
  • Os pesos abertos estão disponíveis no Hugging Face, suportados pelo vLLM e por implantações quantizadas que exigem aproximadamente 168GB de RAM para perda zero em 4-bit.

O lançamento redefine a atual guerra de preços ao oferecer desempenho próximo ao de sistemas proprietários de alta gama por uma fração do custo, incentivando os desenvolvedores a integrá-lo às suas pilhas de codificação existentes.