DeepSeek telah meluncurkan DeepSeek v4.1-Flash, model unggulan bobot terbuka baru yang menampilkan arsitektur kausal encoder-decoder novel yang dirancang untuk memaksimalkan efisiensi inferensi dan mengurangi biaya.
Model ini menggunakan struktur campuran ahli dengan 763 miliar parameter total, tetapi hanya mengaktifkan 8B parameter untuk pemrosesan input dan 16B untuk generasi output. Desain ini mencapai sparsity 1-2% dan mengurangi jejak cache KV menjadi seperdelapan dari model V4 Flash sebelumnya. Model ini mendukung jendela konteks 1M token dengan input teks dan gambar di bawah lisensi MIT.
Benchmark independen dari Artificial Analysis dan Vals peringkat v4.1-Flash sebagai model bobot terbuka teratas, mengutip rasio biaya-kinerja yang unggul dengan harga $0.30 per juta token input.