DeepSeek telah merilis V4.1-Flash, model unggulan bobot terbuka baru yang dirancang untuk efisiensi inferensi ekstrem dan biaya rendah. Model ini memanfaatkan arsitektur encoder-decoder kausal untuk secara signifikan mengurangi komputasi aktif dan biaya KV/cache.
- Skor 40 pada Indeks Kecerdasan Artificial Analysis, melampaui DeepSeek V4 Pro 0813 dengan biaya $0.30 per 1M token input.
- Arsitektur ini memiliki total 763B parameter dengan hanya 8B aktif untuk input dan 16B aktif untuk output.
- Mendukung jendela konteks 1M-token dan menerima input teks serta gambar di bawah lisensi MIT.
- Evaluasi independen menunjukkan hasil seri dengan GPT-6 Astra pada AutomationBench-AA sebesar 69% dan menyamai GPT-5.6 Sol pada AA-LCR v1.1 sebesar 84%.
- Pengguna melaporkan menjalankan model secara lokal pada perangkat keras komersial, mencapai throughput tinggi melalui streaming SSD dan offloading.
Rilis ini menempatkan V4.1-Flash sebagai alternatif yang hemat biaya dibandingkan model tertutup, menawarkan metrik kinerja kuat dengan harga sepersekian.