DeepSeek AI a publié DeepSeek-V4.1-Flash, un modèle Mixture-of-Experts multimodal disposant d'une fenêtre de contexte de 1 million de tokens et d'un cache KV FP4 qui réduit l'empreinte globale du cache à 890 octets par token. Le modèle utilise une architecture encodeur-décodeur causal et Compressed Sparse Attention 2 (CSA2) pour réduire considérablement les besoins en mémoire tout en maintenant les performances.

  • Le modèle possède 552B de paramètres de base, 196B de paramètres Engram, et active 8B de paramètres lors du préremplissage et 16B lors du décodage.
  • Une structure encodeur-décodeur causale divise par deux le calcul de préremplissage en dérivant le KV global du décodeur à partir de l'état caché final de l'encodeur.
  • CSA2 attribue les couches aux modes Full, Reindex ou Reuse pour partager les caches KV principaux et les indexeurs entre les couches.
  • La quantification FP4 du cache KV principal réduit le stockage par rapport au cache FP8 de V4 de près de moitié.
  • Le modèle égale DeepSeek-V4-Pro-Base en connaissances mondiales et en codage tout en utilisant 1/3 des paramètres totaux.
  • Il surpasse Opus-5 et GPT-5.6 Sol sur les benchmarks Terminal-Bench 2.1 et DeepSWE v1.1.

Le modèle à poids ouverts est disponible sous licence MIT via Hugging Face avec le support de vLLM, SGLang et Transformers, offrant une API publique avec des niveaux de raisonnement bas, élevés et max.