कठिन एजेंटिक कार्यों पर ओपन-वेट मॉडल के आंतरिक मूल्यांकन ने पाया कि DeepSeek v4 flash अपने समकक्षों में सबसे तेज़ और सस्ता विकल्प है। इस परीक्षण में कई अनुप्रयोगों में लंबे समय तक चलने वाले वर्कफ़्लो शामिल थे, जिनका मूल्यांकन पूर्ण सफलता की आवश्यकता वाले निर्धारक जाँच द्वारा किया गया था।

  • DeepSeek v4 flash ने कार्यों को 164 सेकंड में पूरा किया, जो GLM 5.2 से लगभग 2.5 गुना तेज़ और Kimi K3 से 1.4 गुना तेज़ है।
  • प्रति कार्य लागत DeepSeek के लिए लगभग $0.08 थी, जबकि GLM 5.2 के लिए $0.57 और Kimi K3 के लिए $1.39 थी।
  • सफलता की दरें तीनों मॉडल में लगभग समान थीं: DeepSeek ने 20/30 प्राप्त किया, जबकि GLM और Kimi दोनों ने 21/30 स्कोर किया।
  • Fable 5 (24/30) और GPT-5.6 Sol (24/30) जैसे फ्रंटियर मॉडल की तुलना में कम सफलता दरों के बावजूद, DeepSeek ने गति और लागत दक्षता में महत्वपूर्ण प्रदर्शन लाभ प्रदान किया।

परिणाम सुझाते हैं कि जबकि शीर्ष स्तर के मॉडल कच्ची क्षमता के लिए श्रेष्ठ बने हुए हैं, DeepSeek v4 flash एजेंटिक वर्कफ़्लो के लिए एक अत्यधिक कुशल विकल्प प्रदान करता है।