DeepSeek a publié DeepSeek-V4.1-Flash, un modèle Mixture-of-Experts multimodal conçu pour répondre aux coûts élevés du calcul de contexte long et des grands caches KV dans les charges de travail d'agents.

Le modèle présente une architecture Causal Encoder-Decoder qui n'active que 8B de paramètres lors du prefill, contre 16B lors du decode. Il atteint une empreinte globale de cache KV de 890 octets par token en combinant Compressed Sparse Attention 2 avec la mise en cache FP4, ce qui représente environ un quart de la ligne de base DeepSeek-V4-Flash. L'utilisation persistante du cache KV sur SSD ou mémoire hôte est réduite à environ un huitième de la version précédente grâce à l'optimisation SWA Bounded Replay. Le modèle a été préentraîné sur un corpus multimodal de 45T tokens et prend en charge des contextes allant jusqu'à un million de tokens.

Ces modifications architecturales améliorent substantiellement l'efficacité des coûts pour les charges de travail lourdes en entrée, tout en offrant de meilleures performances que la ligne de base malgré une empreinte mémoire significativement plus faible.