Benchmark results
media The Batch · منذ 2 يوم Code Arena (Elo) · 1577.0Elo · مشاهدة واحدة

ديب سيك تطلق V4-Flash-0731، متفوقة على V4-Pro بتكلفة أقل

أطلقت ديب سيك نموذج DeepSeek-V4-Flash-0731، وهو نسخة محدثة من نموذجها الأصغر "Flash" الذي يتفوق على النموذج الأكبر DeepSeek-V4-Pro في الاختبارات المستقلة. تعتمد الإصدار عملية ضبط دقيقة جديدة مع الحفاظ على بنية المزيج من الخبراء الأصلية التي تحتوي على 284 مليار معامل إجمالي.

arxiv arXiv cs.AI · منذ 3 يوم

يصحّح SciCode-Verified عيوب المعيار ليكشف القدرة الحقيقية للنماذج في البرمجة العلمية

يحدد المؤلفون أن تراجُع النتائج على معيار SciCode ينجم عن عيوب كبيرة في أداة التقييم وليس عن قيود في قدرة النموذج. كشف تدقيق من خبراء المجال لـ 65 مشكلة اختبارية عن 263 عيبًا، تسبب 192 منها في رفض الحلول الصحيحة بشكل خاطئ بسبب مشكلات مثل إجابات مرجعية غير قابلة للتكرار وتسامحات ضيقة للغاية.

media AI News (smol.ai) · منذ 4 يوم Terminal-Bench 2 · 67.4% · 8 مشاهدات

أليبابا تعلن عن Qwen3.8-Max بـ 2.4T معلمة وأوزان مفتوحة قادمة

أعلنت أليبابا عن Qwen3.8-Max كنموذجها الرائد الجديد، واصفة إياه بأنه بنية متفرغة تحتوي على 2.4T معلمة تركز على العمل الوكيل طويل المدى، والبرمجة، والاستدلال متعدد الوسائط. وأكدت الشركة أن الأوزان المفتوحة لـ Qwen3.8-Max ستُطلق الأسبوع المقبل جنباً إلى جنب مع النسخة ذات الأوزان المفتوحة Qwen3.8-27B.

media r/LocalLLaMA · منذ 4 يوم · مشاهدتان

Qwen 3.8 Max يحقق 1588 في معيار النقاش، بزيادة من 1462 لـ Qwen 3.7 Max

حقق Qwen 3.8 Max نتيجة قدرها 1588 في معيار النقاش (Debate Benchmark)، محسّناً بذلك نتيجة Qwen 3.7 Max البالغة 1462. يقيّم هذا المعيار مدى قدرة النماذج اللغوية الكبيرة على الحفاظ على حجة تحت معارضة عدائية ومتعددة الأدوار عبر مواضيع مختلفة.

media r/LocalLLaMA · منذ 6 يوم · مشاهدتان

تتصدر DeepSeek v4 flash النماذج مفتوحة الأوزان من حيث السرعة والتكلفة في المهام الوكيلية

أظهر تقييم داخلي للنماذج مفتوحة الأوزان في مهام وكيلية صعبة أن DeepSeek v4 flash هو الأسرع والأرخص بين منافسيه. تضمنت الاختبار سير عمل طويل المدى عبر تطبيقات متعددة، وتم تقييمها بفحوصات حتمية تتطلب نجاحاً كاملاً.

media Hugging Face Forums · منذ 7 يوم · 8 مشاهدات

ليفنت بولوت يقيّم موثوقية تسميات النماذج اللغوية الكبيرة على الإسقاط الموضوعي

نشر ليفنت بولوت معيارًا يتكون من ثلاث دراسات لتقييم موثوقية التسميات التي تولّدها الآلة لمجموعة سرديات تركية، وكشف عن تناقضات كبيرة بين المقيمين الآليين والحكم البشري. اختبرت الدراسة ست سمات حرفية ثنائية عبر 120 و100 مشهد باستخدام كاشفات قائمة على القواعد ونماذج بما في ذلك Gemini 2.5 Flash وGrok وChatGPT 5.5 وClaude Fable 5 High.

media r/LocalLLaMA · منذ 9 يوم · 3 مشاهدات

ديب سيك في 4 فلاش بأوزان مفتوحة بـ 284 مليار إجمالي و13 مليار نشط يفرض خفض الأسعار

يشير ميم مترجم يتداول على ريدت إلى أن منافساً اضطر لخفض أسعاره بنسبة 80% بسبب الضغط التنافسي من ديب سيك في 4 فلاش. يتميز هذا النموذج ذو الأوزان المفتوحة بـ 284 مليار معامل إجمالي و13 مليار معامل نشط، مما يوفر مقاييس فائقة للعلاقة بين السعر والأداء.

media r/LocalLLaMA · منذ 9 يوم · 13 مشاهدة

تحديثات DeepSeek V4 Flash بتحسين نتائج Terminal Bench وToolathlon

قامت DeepSeek بتحديث نموذجها V4 Flash، بإصدار نسخة جديدة في 2026-07-31 تُظهر مكاسب أداء كبيرة مقارنة بالإصدار التجريبي السابق. يُدخل التحديث نتائج لمعايير تقييم جديدة بينما يحسّن النتائج على المعايير الحالية.