DeepSeek ने DeepSeek-V4.1-Flash जारी किया है, जो एक बहुआयामी Mixture-of-Experts मॉडल है जिसे एजेंटिक वर्कलोड में लंबे संदर्भ की गणना और बड़े KV कैश के उच्च खर्च को दूर करने के लिए डिज़ाइन किया गया है।

मॉडल में एक Causal Encoder-Decoder आर्किटेक्चर है जो प्रीफिल के दौरान केवल 8B पैरामीटर सक्रिय करता है, जबकि डिकोड के दौरान 16B सक्रिय होते हैं। यह Compressed Sparse Attention 2 और FP4 कैशिंग को मिलाकर प्रति टोकन 890 बाइट्स का वैश्विक KV कैश फुटप्रिंट हासिल करता है, जो DeepSeek-V4-Flash बेलाइन का लगभग एक चौथाई है। SWA Bounded Replay ऑप्टिमाइजेशन के माध्यम से SSD या होस्ट मेमोरी पर स्थिर KV कैश उपयोग को पिछले संस्करण का लगभग आठवां हिस्सा कम कर दिया गया है। मॉडल को 45T टोकन के एक बहुआयामी कॉर्पस पर प्रीट्रेन किया गया था और यह एक मिलियन टोकन तक के संदर्भों का समर्थन करता है।

इन आर्किटेक्चरल बदलावों ने इनपुट-भारी वर्कलोड के लिए लागत दक्षता को काफी बढ़ा दिया है, जबकि महत्वपूर्ण रूप से छोटी मेमोरी फुटप्रिंट होने के बावजूद बेलाइन की तुलना में बेहतर प्रदर्शन प्रदान करता है।