A DeepSeek lançou o DeepSeek v4.1-Flash, um novo modelo principal de pesos abertos que apresenta uma nova arquitetura causal codificador-decodificador projetada para maximizar a eficiência da inferência e reduzir custos.
O modelo utiliza uma estrutura de mistura de especialistas com 763 bilhões de parámetros totais, mas ativa apenas 8B parámetros para o processamento de entrada e 16B para a geração de saída. Este design alcança uma esparsidade de 1-2% e reduz a pegada do cache KV para um oitavo do modelo V4 Flash anterior. Ele suporta uma janela de contexto de 1M tokens com entradas de texto e imagem sob uma licença MIT.
Avaliações independentes da Artificial Analysis e Vals classificam o v4.1-Flash como o melhor modelo de pesos abertos, citando sua superior relação custo-benefício com preço de $0.30 por milhão de tokens de entrada.