DeepSeek AI telah merilis DeepSeek-V4.1-Flash, sebuah model Mixture-of-Experts multimodal yang dilengkapi jendela konteks 1 juta token dan cache KV FP4 yang mengurangi jejak cache global menjadi 890 byte per token. Model ini memanfaatkan arsitektur encoder-decoder kausal dan Compressed Sparse Attention 2 (CSA2) untuk secara signifikan menurunkan kebutuhan memori sambil mempertahankan kinerja.
- Model ini memiliki 552B parameter backbone, 196B parameter Engram, dan mengaktifkan 8B parameter selama prefill serta 16B selama decode.
- Struktur encoder-decoder kausal mengurangi setengah komputasi prefill dengan menurunkan KV global decoder dari state tersembunyi akhir encoder.
- CSA2 menetapkan lapisan ke mode Full, Reindex, atau Reuse untuk berbagi cache KV utama dan indeks indexer di seluruh lapisan.
- Kuantisasi FP4 pada cache KV utama memotong penyimpanan terhadap cache FP8 V4 hampir setengahnya.
- Model ini menyamai DeepSeek-V4-Pro-Base dalam pengetahuan dunia dan pemrograman sambil menggunakan 1/3 dari total parameter.
- Model ini mengungguli Opus-5 dan GPT-5.6 Sol pada benchmark Terminal-Bench 2.1 dan DeepSWE v1.1.
Model open-weight tersedia di bawah lisensi MIT melalui Hugging Face dengan dukungan untuk vLLM, SGLang, dan Transformers, menawarkan API publik dengan tingkatan penalaran rendah, tinggi, dan maksimal.