DeepSeek meluncurkan API DeepSeek-V4-Flash dalam beta publik dan segera merilis bobotnya di bawah lisensi MIT. Pembaruan ini memberikan peningkatan kinerja yang signifikan dibandingkan pratinjau April tanpa mengubah arsitektur atau ukuran model, memposisikannya sebagai alternatif yang hemat biaya dibandingkan model tertutup.
- Flash API melampaui V4-Pro-Preview dalam kemampuan agen dan mendukung format Responses API.
- Skor Terminal-Bench melonjak dari 56,9 menjadi 82,7, sementara Elo GDPval-AA naik dari 1189 menjadi 1559.
- Model mempertahankan jumlah parameter total 284B / aktif 13B dan jendela konteks 1M.
- Harga ditetapkan sebesar $0,14/$0,28 per 1M token, dengan diskon cache-hit 98% yang mengurangi biaya cache menjadi $0,0028/1M.
- Bobot terbuka tersedia di Hugging Face, didukung oleh vLLM dan implementasi kuantisasi yang membutuhkan sekitar 168GB RAM untuk 4-bit tanpa kehilangan data.
Rilis ini mengubah perang harga saat ini dengan menawarkan kinerja yang mendekati sistem tertutup kelas atas dengan biaya sepersekian, mendorong pengembang untuk mengintegrasikannya ke dalam tumpukan pemrograman yang ada.