DeepSeek a publié le modèle officiel DeepSeek-V4-Flash-0731 sur Hugging Face et a mis son API en bêta publique à partir du 31 juillet 2026. Cette version remplace la version antérieure par un repost-training plutôt que par des changements architecturaux, apportant des améliorations significatives aux benchmarks agentic et de codage tout en conservant la même taille de 284B paramètres.
- Le modèle présente une architecture MoE de 284B paramètres avec 13B activés par token et inclut le module de décodage spéculatif DSpark.
- Il obtient des scores supérieurs à V4-Pro (Preview) sur tous les benchmarks agentic publiés, dont 82.7 sur Terminal Bench 2.1 et 54.2 sur NL2Repo.
- Les tarifs de l'API sont fixés à 0,14 $ par 1M de tokens d'entrée et 0,28 $ par 1M de tokens de sortie, soit environ un tiers du coût de V4-Pro.
- Les poids sont sous licence MIT et sans restriction, permettant l'hébergement autonome sur environ 110 Go de mémoire avec quantification ou sur un nœud 4×GB300 pour une précision complète.
La mise à jour offre une option rentable pour les boucles d'agents et les tâches de codage, offrant des performances rivalisant avec des modèles plus coûteux tout en restant accessible aux développeurs indépendants et aux entreprises via l'API ou l'hébergement autonome.