DeepSeek telah resmi merilis model DeepSeek V4.1 Flash, entri terkecil dalam seri arsitektur barunya yang memiliki pemahaman visual multimodal asli. Dibangun di atas desain Causal-Encoder-Decoder, ini adalah model Mixture of Experts (MoE) dengan 552B parameter yang hanya mengaktifkan 8B parameter pada sisi input dan 16B pada sisi output.
- Arsitektur asimetris secara signifikan mengurangi biaya inferensi dibandingkan dengan model seukuran yang sudah ada.
- Kompresi cache KV mengurangi kebutuhan HBM menjadi 1/4 dan kebutuhan SSD menjadi 1/8 dari generasi sebelumnya, menurunkan biaya untuk tugas bergaya agen.
- Pengujian benchmark menunjukkan V4.1 Flash melampaui tingkat kecerdasan model unggulan termasuk DeepSeek V4 Pro.
- Model ini sekarang aktif di API DeepSeek dengan nama `deepseek-flash`, dengan varian V4 Flash yang lebih lama dialihkan ke sana secara sementara.
- Harga telah disesuaikan dengan tarif puncak/luar puncak, dan permintaan ke `deepseek-v4-pro` akan dialihkan ke V4.1 Flash setelah 14 September 2026.
Arsitektur baru ini bertujuan untuk menyediakan batas kemampuan yang lebih tinggi, inferensi yang lebih cepat, throughput yang lebih besar, dan skalabilitas ke model dengan parameter lebih besar sambil melayani lebih banyak pengguna dengan biaya lebih rendah.