DeepSeek telah merilis V4.1-Flash, model unggulan bobot terbuka baru yang dirancang untuk efisiensi inferensi ekstrem dan biaya rendah. Model ini memanfaatkan arsitektur encoder-decoder kausal untuk secara signifikan mengurangi komputasi aktif dan biaya KV/cache.

  • Skor 40 pada Indeks Kecerdasan Artificial Analysis, melampaui DeepSeek V4 Pro 0813 dengan biaya $0.30 per 1M token input.
  • Arsitektur ini memiliki total 763B parameter dengan hanya 8B aktif untuk input dan 16B aktif untuk output.
  • Mendukung jendela konteks 1M-token dan menerima input teks serta gambar di bawah lisensi MIT.
  • Evaluasi independen menunjukkan hasil seri dengan GPT-6 Astra pada AutomationBench-AA sebesar 69% dan menyamai GPT-5.6 Sol pada AA-LCR v1.1 sebesar 84%.
  • Pengguna melaporkan menjalankan model secara lokal pada perangkat keras komersial, mencapai throughput tinggi melalui streaming SSD dan offloading.

Rilis ini menempatkan V4.1-Flash sebagai alternatif yang hemat biaya dibandingkan model tertutup, menawarkan metrik kinerja kuat dengan harga sepersekian.