DeepSeek a officiellement publié le modèle DeepSeek V4.1 Flash, la version la plus légère de sa nouvelle série d'architectures dotée d'une compréhension visuelle multimodale native. Construit sur une conception Causal-Encoder-Decoder, il s'agit d'un modèle Mixture of Experts (MoE) de 552 milliards de paramètres qui n'active que 8 milliards de paramètres du côté entrée et 16 milliards du côté sortie.

  • L'architecture asymétrique réduit considérablement les coûts d'inférence par rapport aux modèles connus de taille similaire.
  • La compression du cache KV réduit les besoins en HBM à 1/4 et ceux en SSD à 1/8 de la génération précédente, abaissant les coûts pour les tâches de type agent.
  • Les tests de benchmark montrent que V4.1 Flash dépasse le niveau d'intelligence des modèles phares, y compris DeepSeek V4 Pro.
  • Le modèle est désormais disponible sur l'API DeepSeek sous le nom `deepseek-flash`, les anciennes variantes V4 Flash étant redirigées vers lui temporairement.
  • La tarification a été ajustée avec des tarifs de pointe et creux, et les requêtes adressées à `deepseek-v4-pro` seront routées vers V4.1 Flash après le 14 septembre 2026.

La nouvelle architecture vise à offrir un plafond de capacités plus élevé, une inférence plus rapide, un débit accru et une évolutivité vers des modèles à plus grands paramètres, tout en servant davantage d'utilisateurs à moindre coût.