Evaluasi internal terhadap model open-weight pada tugas agentic yang sulit menemukan DeepSeek v4 flash sebagai opsi tercepat dan termurah di antara rekan-rekannya. Pengujian melibatkan alur kerja jangka panjang di berbagai aplikasi, dinilai dengan pemeriksaan deterministik yang mensyaratkan keberhasilan penuh.

  • DeepSeek v4 flash menyelesaikan tugas dalam 164 detik, hampir 2,5 kali lebih cepat daripada GLM 5.2 dan 1,4 kali lebih cepat daripada Kimi K3.
  • Biaya per tugas sekitar $0,08 untuk DeepSeek, dibandingkan dengan $0,57 untuk GLM 5.2 dan $1,39 untuk Kimi K3.
  • Tingkat keberhasilan hampir identik di ketiga model: DeepSeek mencapai 20/30, sementara GLM dan Kimi masing-masing mencetak 21/30.
  • Meskipun tingkat keberhasilannya lebih rendah daripada model frontier seperti Fable 5 (24/30) dan GPT-5.6 Sol (24/30), DeepSeek menawarkan keunggulan kinerja yang signifikan dalam kecepatan dan efisiensi biaya.

Hasil ini menunjukkan bahwa meskipun model state-of-the-art tetap unggul dalam kemampuan mentah, DeepSeek v4 flash menyediakan alternatif yang sangat efisien untuk alur kerja agentic.