DeepSeek a lancé DeepSeek v4.1-Flash, un nouveau modèle phare à poids ouverts présentant une nouvelle architecture causale encodeur-décodeur conçue pour maximiser l'efficacité de l'inférence et réduire les coûts.

Le modèle utilise une structure de mélange d'experts avec 763 milliards de paramètres au total, mais n'active que 8B de paramètres pour le traitement de l'entrée et 16B pour la génération de sortie. Cette conception atteint une parcimonie de 1 à 2 % et réduit l'emprise du cache KV à un huitième de celle du modèle V4 Flash précédent. Il prend en charge une fenêtre de contexte de 1M de tokens avec des entrées textuelles et image sous licence MIT.

Les benchmarks indépendants d'Artificial Analysis et de Vals classent v4.1-Flash comme le meilleur modèle à poids ouverts, citant son excellent rapport coût-performance avec un prix de 0,30 $ par million de tokens d'entrée.