DeepSeek a lancé l'API DeepSeek-V4-Flash en bêta publique et a immédiatement publié ses poids sous licence MIT. Cette mise à jour offre des améliorations de performances significatives par rapport à l'aperçu d'avril sans modifier l'architecture ou la taille du modèle, se positionnant ainsi comme une alternative rentable aux modèles propriétaires.
- L'API Flash dépasse V4-Pro-Preview en capacités d'agent et prend en charge le format Responses API.
- Les scores Terminal-Bench ont bondi de 56,9 à 82,7, tandis que l'Elo GDPval-AA est passé de 1189 à 1559.
- Le modèle conserve son compte total de 284B / 13B paramètres actifs et sa fenêtre de contexte de 1M.
- La tarification est fixée à 0,14 $/0,28 $ par 1M de tokens, avec une réduction de 98 % pour les hits en cache ramenant le coût du cache à 0,0028 $/1M.
- Les poids ouverts sont disponibles sur Hugging Face, pris en charge par vLLM et les déploiements quantifiés nécessitant environ 168 Go de RAM pour une compression 4-bit sans perte.
Cette publication reformule la guerre des prix actuelle en offrant des performances proches des systèmes propriétaires haut de gamme à une fraction du coût, encourageant les développeurs à l'intégrer dans leurs piles de codage existantes.