A DeepSeek AI lançou o DeepSeek-V4.1-Flash, um modelo Mixture-of-Experts multimodal que possui uma janela de contexto de 1 milhão de tokens e um cache KV FP4 que reduz a pegada global do cache para 890 bytes por token. O modelo utiliza uma arquitetura de codificador-decodificador causal e Compressed Sparse Attention 2 (CSA2) para reduzir significativamente os requisitos de memória enquanto mantém o desempenho.
- O modelo possui 552B parâmetros de backbone, 196B parâmetros Engram e ativa 8B parâmetros durante o prefill e 16B durante o decode.
- Uma estrutura de codificador-decodificador causal reduz pela metade o cálculo do prefill ao derivar o KV global do decodificador a partir do estado oculto final do codificador.
- O CSA2 atribui camadas aos modos Full, Reindex ou Reuse para compartilhar os caches KV principais e os índices do indexador entre as camadas.
- A quantização FP4 do cache KV principal reduz o armazenamento em relação ao cache FP8 do V4 em quase metade.
- O modelo iguala o DeepSeek-V4-Pro-Base em conhecimento mundial e codificação, utilizando apenas 1/3 dos parâmetros totais.
- Ele supera o Opus-5 e o GPT-5.6 Sol nos benchmarks Terminal-Bench 2.1 e DeepSWE v1.1.
O modelo de pesos abertos está disponível sob uma licença MIT via Hugging Face, com suporte para vLLM, SGLang e Transformers, oferecendo uma API pública com níveis de raciocínio baixo, alto e máximo.