نتائج DeepSeek V4 Flash 0731 على ARC-AGI
يقدم المقال نتائج معيار ARC-AGI لنموذج DeepSeek V4 Flash 0731. ويربط بالصفحة الرسمية للنتائج التي تستضيفها منظمة ARC Prize.
يقدم المقال نتائج معيار ARC-AGI لنموذج DeepSeek V4 Flash 0731. ويربط بالصفحة الرسمية للنتائج التي تستضيفها منظمة ARC Prize.
أطلقت ديب سيك نموذج DeepSeek-V4-Flash-0731، وهو نسخة محدثة من نموذجها الأصغر "Flash" الذي يتفوق على النموذج الأكبر DeepSeek-V4-Pro في الاختبارات المستقلة. تعتمد الإصدار عملية ضبط دقيقة جديدة مع الحفاظ على بنية المزيج من الخبراء الأصلية التي تحتوي على 284 مليار معامل إجمالي.
يكشف مقارنة بين DeepSeek-V4 Flash 0731 وGPT-5.6 Luna على معيار DeepSWE أن GPT-5.6 Luna هو المهندس الأقوى، إلا أن استراتيجية التسلسل التي تستخدم كلا النموذجين تحقق دقة أعلى بتكلفة أقل.
قامت Artificial Analysis بتحديث مؤشرها الوكيل لتصنيف Qwen 3.8 Max كأفضل نموذج شامل، ووضعته أمام Opus 5.
يحدد المؤلفون أن تراجُع النتائج على معيار SciCode ينجم عن عيوب كبيرة في أداة التقييم وليس عن قيود في قدرة النموذج. كشف تدقيق من خبراء المجال لـ 65 مشكلة اختبارية عن 263 عيبًا، تسبب 192 منها في رفض الحلول الصحيحة بشكل خاطئ بسبب مشكلات مثل إجابات مرجعية غير قابلة للتكرار وتسامحات ضيقة للغاية.
أعلنت أليبابا عن Qwen3.8-Max كنموذجها الرائد الجديد، واصفة إياه بأنه بنية متفرغة تحتوي على 2.4T معلمة تركز على العمل الوكيل طويل المدى، والبرمجة، والاستدلال متعدد الوسائط. وأكدت الشركة أن الأوزان المفتوحة لـ Qwen3.8-Max ستُطلق الأسبوع المقبل جنباً إلى جنب مع النسخة ذات الأوزان المفتوحة Qwen3.8-27B.
حقق Qwen 3.8 Max نتيجة قدرها 1588 في معيار النقاش (Debate Benchmark)، محسّناً بذلك نتيجة Qwen 3.7 Max البالغة 1462. يقيّم هذا المعيار مدى قدرة النماذج اللغوية الكبيرة على الحفاظ على حجة تحت معارضة عدائية ومتعددة الأدوار عبر مواضيع مختلفة.
أظهر تقييم داخلي للنماذج مفتوحة الأوزان في مهام وكيلية صعبة أن DeepSeek v4 flash هو الأسرع والأرخص بين منافسيه. تضمنت الاختبار سير عمل طويل المدى عبر تطبيقات متعددة، وتم تقييمها بفحوصات حتمية تتطلب نجاحاً كاملاً.
يُعد Qwen3.8-Max (2.4T) نموذجًا جديدًا بأوزان مفتوحة يؤدي أداءً قريبًا جدًا من Kimi K3 وDeepSeek V4 Flash عبر جميع فئات الاختبارات المرجعية، بينما يُظهر أداءً متفوقًا في مهام البرمجة والبرمجيات.
تم إطلاق Qwen 3.8-Max ويشغل حالياً المركز #2 في لوحة المتصدرين لـ Vision Arena، متخلفاً فقط عن Claude Fable 5 Max.
تعلن المقالة أن نموذج DeepSeek-V4-Flash-0731 قد تفوق على Fable-5 وSol وKimi-K3 في معيار للشطرنج.
نشر ليفنت بولوت معيارًا يتكون من ثلاث دراسات لتقييم موثوقية التسميات التي تولّدها الآلة لمجموعة سرديات تركية، وكشف عن تناقضات كبيرة بين المقيمين الآليين والحكم البشري. اختبرت الدراسة ست سمات حرفية ثنائية عبر 120 و100 مشهد باستخدام كاشفات قائمة على القواعد ونماذج بما في ذلك Gemini 2.5 Flash وGrok وChatGPT 5.5 وClaude Fable 5 High.
حققت نموذج DeepSeek-V4-Flash-0731 درجة مؤشر ذكاء تبلغ 50، وهي مقياس يتطابق مع أداء النماذج المتقدمة الرائدة من مارس 2026، والتي كانت لديها درجة 51.
يشير ميم مترجم يتداول على ريدت إلى أن منافساً اضطر لخفض أسعاره بنسبة 80% بسبب الضغط التنافسي من ديب سيك في 4 فلاش. يتميز هذا النموذج ذو الأوزان المفتوحة بـ 284 مليار معامل إجمالي و13 مليار معامل نشط، مما يوفر مقاييس فائقة للعلاقة بين السعر والأداء.
تدعي DeepSeek أن نموذجها الجديد المتاح بشكل عام، DeepSeek V4 Flash، يحقق تكافؤًا في الأداء مع Anthropic's Sonnet 5 و xAI's Grok 4.5 على مقياس DeepSWE.
يتفوق نموذج DeepSeek-V4-Flash-0731 الآن بشكل كبير على DeepSeek-V4-Pro-Preview في مختلف اختبارات المعايير.
حقق نموذج DeepSeek V4-Flash الجديد درجة 50 في مؤشر ArtificialAnalysis. يضعه هذا النتيجة على بعد نقطة واحدة فقط من GLM-5.2 وGPT-5.6 Luna.
يتفوق نموذج DeepSeek-V4-Flash-0731 على GLM 5.2 مع الحفاظ على نفس السعر مثل سلفه.
قامت DeepSeek بتحديث نموذجها V4 Flash، بإصدار نسخة جديدة في 2026-07-31 تُظهر مكاسب أداء كبيرة مقارنة بالإصدار التجريبي السابق. يُدخل التحديث نتائج لمعايير تقييم جديدة بينما يحسّن النتائج على المعايير الحالية.
قام مستخدم بتقييم Kimi K3 مقابل Claude Opus 4.8 من خلال تشغيل 34 طلبًا للنمذجة الواحدة وتقييم HTML ولقطات الشاشة وملفات GIF الناتجة باستخدام Sonnet 4.6. خلص التقييم إلى أن Kimi K3 أنتج نتائج أفضل من Opus 4.8.