قامت DeepSeek بتحديث نموذجها V4 Flash، بإصدار نسخة جديدة في 2026-07-31 تُظهر مكاسب أداء كبيرة مقارنة بالإصدار التجريبي السابق. يُدخل التحديث نتائج لمعايير تقييم جديدة بينما يحسّن النتائج على المعايير الحالية.

  • ارتفع نتيجة Terminal Bench من 56.9 إلى 82.7 (ملاحظة: تغير المعيار من v2.0 إلى v2.1).
  • ارتفعت نتيجة Toolathlon من 51.8 إلى 70.3.
  • تشمل نتائج معايير التقييم الجديدة NL2Repo (54.2)، وCybergym (76.7)، وDeepSWE (54.4)، وAgent Last Exam (25.2)، وAutomation Bench (25.1)، وDSBench-FullStack (68.7)، وDSBench-Hard (59.6).
  • مقارنة بـ GPT-5.6 Terra، يتفوق V4 Flash في Terminal Bench (+4.3) وToolathlon (+17.2)، بينما تتفوق Terra في DeepSWE (+15.2) وAgents' Last Exam (+25.2).

يوفر التحديث نسخة أكثر قدرة من النموذج للمهام المتعلقة بالوكلاء، رغم أن الأداء مقارنة بالمنافسين مثل GPT-5.6 Terra يظل متفاوتًا اعتمادًا على معيار التقييم المحدد.