DeepSeek AI ha lanzado DeepSeek-V4.1-Flash, un modelo multimodal Mixture-of-Experts que cuenta con una ventana de contexto de 1 millón de tokens y una caché KV FP4 que reduce la huella global de la caché a 890 bytes por token. El modelo utiliza una arquitectura de codificador-decodificador causal y Compressed Sparse Attention 2 (CSA2) para reducir significativamente los requisitos de memoria mientras mantiene el rendimiento.

  • El modelo tiene 552B parámetros de backbone, 196B parámetros Engram, y activa 8B parámetros durante el prefill y 16B durante el decode.
  • Una estructura de codificador-decodificador causal reduce a la mitad el cómputo del prefill al derivar el KV global del decodificador a partir del estado oculto final del codificador.
  • CSA2 asigna capas a modos Full, Reindex o Reuse para compartir las cachés KV principales y los índices del indexador entre capas.
  • La cuantización FP4 de la caché KV principal reduce el almacenamiento frente a la caché FP8 de V4 en casi la mitad.
  • El modelo iguala a DeepSeek-V4-Pro-Base en conocimiento mundial y codificación mientras usa 1/3 de los parámetros totales.
  • Supera a Opus-5 y GPT-5.6 Sol en los benchmarks Terminal-Bench 2.1 y DeepSWE v1.1.

El modelo de pesos abiertos está disponible bajo una licencia MIT a través de Hugging Face con soporte para vLLM, SGLang y Transformers, ofreciendo una API pública con niveles de razonamiento bajo, alto y máximo.