أطلقت DeepSeek نموذج DeepSeek-V4.1-Flash، وهو نموذج Mixture-of-Experts متعدد الوسائط مصمم لمعالجة التكاليف العالية لحساب السياق الطويل والذاكرة المؤقتة الكبيرة KV في أعباء العمل الوكيلية.

يتميز النموذج ببنية Causal Encoder-Decoder التي تنشط 8B معلمة فقط أثناء prefill، مقارنة بـ 16B أثناء decode. يحقق حجم ذاكرة تخزين مؤقت عالمي يبلغ 890 بايت لكل رمز عن طريق الجمع بين Compressed Sparse Attention 2 مع التخزين المؤقت FP4، وهو ما يعادل تقريباً ربع baseline DeepSeek-V4-Flash. تم تقليل الاستخدام المستمر للذاكرة المؤقتة KV على SSD أو ذاكرة المضيف إلى حوالي ثمن الإصدار السابق من خلال تحسين SWA Bounded Replay. تم تدريب النموذج مسبقاً على مجموعة بيانات متعددة الوسائط تحتوي على 45T رمز ويدعم سياقات تصل إلى مليون رمز.

تحسن هذه التغييرات المعمارية كفاءة التكلفة بشكل كبير لأعباء العمل المكثفة في الإدخال، مع تقديم أداء أفضل من baseline على الرغم من حجم الذاكرة الأصغر بكثير.