DeepSeek a publié V4.1-Flash, un nouveau modèle phare à poids ouverts conçu pour une efficacité d'inférence extrême et un faible coût. Le modèle utilise une architecture encodeur-décodeur causale pour réduire considérablement le calcul actif et les coûts KV/cache.

  • Il obtient 40 au Artificial Analysis Intelligence Index, dépassant DeepSeek V4 Pro 0813 tout en coûtant 0,30 $ par 1M de tokens d'entrée.
  • L'architecture compte 763B paramètres au total, dont seulement 8B actifs pour l'entrée et 16B actifs pour la sortie.
  • Il prend en charge une fenêtre de contexte de 1M de tokens et accepte à la fois des entrées textuelles et imageuses sous licence MIT.
  • Des évaluations indépendantes montrent qu'il est égal à GPT-6 Astra sur AutomationBench-AA avec 69 % et égale GPT-5.6 Sol sur AA-LCR v1.1 avec 84 %.
  • Les utilisateurs signalent l'exécution locale du modèle sur du matériel grand public, atteignant un débit élevé grâce au streaming SSD et au déchargement.

Le lancement positionne V4.1-Flash comme une alternative rentable aux modèles propriétaires, offrant des indicateurs de performance solides à une fraction du prix.