DeepSeek AI ने DeepSeek-V4.1-Flash जारी किया है, जो एक बहुमोडल मिक्स्चर-ऑफ-एक्सपर्ट्स मॉडल है जिसमें 1-मिलियन-टोकन संदर्भ विंडो और FP4 KV कैश शामिल है जो प्रति टोकन 890 बाइट के वैश्विक कैश फुटप्रिंट को कम करता है। मॉडल एक कारणवादी एन्कोडर-डीकोडर आर्किटेक्चर और कॉम्प्रेस्ड स्पार्स एटेंशन 2 (CSA2) का उपयोग करता है जो प्रदर्शन बनाए रखते हुए मेमोरी की आवश्यकताओं को काफी कम करता है।
- मॉडल में 552B बैकबोन पैरामीटर, 196B एन्ग्राम पैरामीटर हैं, और प्रीफिल के दौरान 8B पैरामीटर सक्रिय होते हैं तथा डिकोड के दौरान 16B सक्रिय होते हैं।
- एक कारणवादी एन्कोडर-डीकोडर संरचना एन्कोडर के अंतिम हाइडन स्टेट से डिकोडर का वैश्विक KV निकालकर प्रीफिल कंप्यूट को आधा कर देती है।
- CSA2 परतों को फुल, रीइंडेक्स, या रीयूज़ मोड में आवंटित करता है ताकि मुख्य KV कैश और इंडेक्सर इंडेस को परतों के बीच साझा किया जा सके।
- मुख्य KV कैश का FP4 क्वांटीजेशन V4 के FP8 कैश की तुलना में भंडारण को लगभग आधा कर देता है।
- मॉडल कुल पैरामीटरों का 1/3 उपयोग करते हुए विश्व ज्ञान और कोडिंग में DeepSeek-V4-Pro-Base के बराबर प्रदर्शन करता है।
- यह Terminal-Bench 2.1 और DeepSWE v1.1 बेंचमार्क्स पर Opus-5 और GPT-5.6 Sol से बेहतर प्रदर्शन करता है।
ओपन-वेट मॉडल Hugging Face के माध्यम से MIT लाइसेंस के तहत उपलब्ध है जिसमें vLLM, SGLang, और Transformers का समर्थन है, जो कम, उच्च, और अधिकतम तर्क स्तरों के साथ एक सार्वजनिक API प्रदान करता है।