A DeepSeek lançou o DeepSeek-V4.1-Flash, um modelo Mixture-of-Experts multimodal projetado para abordar os altos custos de computação de contexto longo e grandes caches KV em cargas de trabalho de agentes.
O modelo apresenta uma arquitetura Causal Encoder-Decoder que ativa apenas 8B parâmetros durante o prefill, comparado a 16B durante o decode. Ele alcança um footprint global de cache KV de 890 bytes por token combinando Compressed Sparse Attention 2 com armazenamento em cache FP4, o que é aproximadamente um quarto da linha de base DeepSeek-V4-Flash. O uso persistente de cache KV em SSD ou memória do host foi reduzido para aproximadamente uma oitava parte da versão anterior através da otimização SWA Bounded Replay. O modelo foi pré-treinado em um corpus multimodal de 45T tokens e suporta contextos de até um milhão de tokens.
Essas mudanças arquiteturais melhoram substancialmente a eficiência de custos para cargas de trabalho pesadas em entrada, entregando melhor desempenho do que a linha de base apesar do footprint de memória significativamente menor.