DeepSeek a publié V4.1-Flash, un nouveau modèle phare à poids ouverts conçu pour une efficacité d'inférence extrême et un faible coût. Le modèle utilise une architecture encodeur-décodeur causale pour réduire considérablement le calcul actif et les coûts KV/cache.
- Il obtient 40 au Artificial Analysis Intelligence Index, dépassant DeepSeek V4 Pro 0813 tout en coûtant 0,30 $ par 1M de tokens d'entrée.
- L'architecture compte 763B paramètres au total, dont seulement 8B actifs pour l'entrée et 16B actifs pour la sortie.
- Il prend en charge une fenêtre de contexte de 1M de tokens et accepte à la fois des entrées textuelles et imageuses sous licence MIT.
- Des évaluations indépendantes montrent qu'il est égal à GPT-6 Astra sur AutomationBench-AA avec 69 % et égale GPT-5.6 Sol sur AA-LCR v1.1 avec 84 %.
- Les utilisateurs signalent l'exécution locale du modèle sur du matériel grand public, atteignant un débit élevé grâce au streaming SSD et au déchargement.
Le lancement positionne V4.1-Flash comme une alternative rentable aux modèles propriétaires, offrant des indicateurs de performance solides à une fraction du prix.