DeepSeek telah merilis DeepSeek-V4.1-Flash, sebuah model Mixture-of-Experts multimodal yang dirancang untuk mengatasi biaya tinggi komputasi konteks panjang dan cache KV besar dalam beban kerja agen.

Model ini memiliki arsitektur Causal Encoder-Decoder yang hanya mengaktifkan 8B parameter selama prefill, dibandingkan dengan 16B selama decode. Model ini mencapai jejak cache KV global sebesar 890 byte per token dengan menggabungkan Compressed Sparse Attention 2 dengan caching FP4, yang merupakan sekitar seperempat dari baseline DeepSeek-V4-Flash. Penggunaan cache KV persisten pada SSD atau memori host dikurangi menjadi sekitar satu-delapan dari versi sebelumnya melalui optimasi SWA Bounded Replay. Model ini dilatih awal pada korpus multimodal berisi 45T token dan mendukung konteks hingga satu juta token.

Perubahan arsitektur ini secara substansial meningkatkan efisiensi biaya untuk beban kerja yang padat input, sambil memberikan kinerja yang lebih baik daripada baseline meskipun jejak memori yang jauh lebih kecil.