الموضوع · Benchmark results
media Interconnects · منذ 8 ساعة

Z.ai تطلق GLM-5.3 مع تدريب ما بعد الامتداد

أعلنت Z.ai عن GLM-5.3، وهو نموذج جديد يحقق أداءً متقدمًا في معايير برمجة الوكلاء من خلال توسيع تدريب ما بعد النموذج الأساسي GLM-5.2. يتفوق النموذج ذو ~750B معلمة حاليًا على Kimi K3 ويساوي أو يتجاوز Claude Fable 5 و GPT-5.6-Sol في معايير مختلفة.

media AI News (smol.ai) · منذ 10 يوم Terminal-Bench 2 · 67.4% · 22 مشاهدة

أليبابا تعلن عن Qwen3.8-Max بـ 2.4T معلمة وأوزان مفتوحة قادمة

أعلنت أليبابا عن Qwen3.8-Max كنموذجها الرائد الجديد، واصفة إياه بأنه بنية متفرغة تحتوي على 2.4T معلمة تركز على العمل الوكيل طويل المدى، والبرمجة، والاستدلال متعدد الوسائط. وأكدت الشركة أن الأوزان المفتوحة لـ Qwen3.8-Max ستُطلق الأسبوع المقبل جنباً إلى جنب مع النسخة ذات الأوزان المفتوحة Qwen3.8-27B.

media r/LocalLLaMA · منذ 15 يوم · 15 مشاهدة

تحديثات DeepSeek V4 Flash بتحسين نتائج Terminal Bench وToolathlon

قامت DeepSeek بتحديث نموذجها V4 Flash، بإصدار نسخة جديدة في 2026-07-31 تُظهر مكاسب أداء كبيرة مقارنة بالإصدار التجريبي السابق. يُدخل التحديث نتائج لمعايير تقييم جديدة بينما يحسّن النتائج على المعايير الحالية.

media Together AI Blog · منذ 19 يوم DeepSWE · 72.7% · 14 مشاهدة

كيمي K3 يتفوق على جي بي تي-5.6 سول في DeepSWE pass@4 ويقلل التكلفة بنسبة 64%

تكشف مقارنة بين كيمي K3 وجي بي تي-5.6 سول على معيار DeepSWE أنه بينما يتصدر جي بي تي-5.6 سول في جودة المحاولة الواحدة (72.7% مقابل 68.5%)، يحقق كيمي K3 نتائج أعلى في درجات pass@k لـ k > 1 بتكلفة أقل بكثير.

media Latent Space · منذ 21 يوم · 4 مشاهدات

أنثروبيك تطلق كلود أوبوس 5 بمؤشر قدرات يبلغ 159

أطلقت أنثروبيك نموذج كلود أوبوس 5، وهو نموذج حدودي جديد أثار نقاشاً كبيراً حول نتائج الاختبارات والأداء العملي. أفادت التقييمات المستقلة من Epoch AI بأن مؤشر قدرات Epoch (ECI) للنموذج الجديد يبلغ 159، ومؤشر SWE-ECI يبلغ 161.

media Together AI Blog · منذ 21 يوم · 8 مشاهدات

يُطابق Kimi K3 أداء Claude Fable 5 على DeepSWE بتكلفة ثلث التكلفة

يحقق Kimi K3، وهو نموذج ذو أوزان مفتوحة من Moonshot AI، أداءً مماثلاً لـ Claude Fable 5 من Anthropic على معيار DeepSWE بينما تكلفته أقل بكثير لكل مهمة. في تقييم بتاريخ 16 يوليو 2026، وصل Kimi K3 إلى نسبة نجاح 68.5% في pass@1 مقارنة بـ 69.9% لـ Fable 5، لكنه تفوق عليه في السيناريوهات متعددة المحاولات وقدم كفاءة تكلفة أعلى.

arxiv τ²-bench (tau2-bench) · منذ 23 يوم · 3 مشاهدات

يُصلح τ-bench 1.0.1 تقييم banking_knowledge لمنع معاقبة سلوك الوكيل الحذر

أصدرت Sierra Research الإصدار τ-bench 1.0.1، الذي يصحح مخطط تقييم مهمة `banking_knowledge` لوقف معاقبة الوكلاء على قراءات التحقق الحذرة، ويُصلح عدة تناقضات في البيانات. يضمن التحديث أن إعادة التقييم لمسارات لوحة المتصدرين تزيد الدرجات فقط، دون فشل أي محاكاة كانت قد نجحت سابقاً.

media AI News (smol.ai) · منذ 28 يوم · 6 مشاهدات

مونشوت تطلق كيمي K3، نموذج صيني مفتوح الأوزان يتمتع بقدرات برمجية وكفاءة عالية

أطلقت مونشوت كيمي K3، وهو نموذج مفتوح الأوزان أحدث إعادة تقييم لقرب النماذج الصينية من الطليعة. يتميز الإصدار بأداء قوي في البرمجة، والمهام الوكيلية، وأعمال المعرفة طويلة المدى.

media Latent Space · منذ 29 يوم · 3 مشاهدات

Moonshot AI تطلق Kimi K3، نموذج حدودي مفتوح بملياري معلمة 2.8T

أعلنت Moonshot AI عن إطلاق Kimi K3، وهو نموذج جديد من فئة الحدود المفتوحة الأوزان، يتميز بـ 2.8 تريليون معلمة إجمالاً وقدرات إدخال متعددة الوسائط بشكل أصيل. يُصنّف رسمياً تحت مسمى "ذكاء الحدود المفتوح"، ويدعم نافذة سياق بحجم مليون توكن، ويستفيد من مكونات معمارية مبتكرة مثل Kimi Delta Attention (KDA) وAttention Residuals لتعزيز الكفاءة.

blog Simon Willison · منذ 29 يوم · 12 مشاهدة

Moonshot AI تعلن عن Kimi K3، نموذجًا بـ 2.8 تريليون معلمة وبأسعار مرتفعة

أعلنت مختبر الذكاء الاصطناعي الصيني Moonshot AI عن Kimi K3، واصفة إياه بأنه أقوى نموذج لديها حتى الآن مع 2.8 تريليون معلمة. يتوفر النموذج حاليًا عبر الموقع الإلكتروني وواجهة برمجة التطبيقات (API)، مع وعد بإصدار الأوزان المفتوحة بحلول 27 يوليو 2026.

media r/LocalLLaMA · منذ 23 ساعة · مشاهدة واحدة

DeepSeek DSv4 Flash 0731 يحقق أداءً عالياً على أجهزة ميسورة التكلفة

يبرز مستخدم في Reddit نموذج DeepSeek DSv4 Flash 0731، مشيراً إلى قدراته القوية في الأداء مقارنة بتكلفته. يشير المنشور إلى Artificial Analysis Intelligence Index v4.1.1 لدعم الادعاء بأن النموذج يؤدي أداءً استثنائياً.

arxiv arXiv cs.AI · منذ 2 يوم HealthBench · 51.9% · 4 مشاهدات

يتطابق VITA السريري المعزز بالاسترجاع أو يتفوق على نماذج اللغات الكبيرة المتقدمة في HealthBench

تم تقييم نظام مُصمم خصيصًا لتوليد النصوص المعزز بالاسترجاع يُدعى VITA، والمُعدّ للبيئات ذات الدخل المنخفض والمتوسط، مقابل نماذج لغوية كبيرة لأغراض عامة على معيار HealthBench. تُظهر الدراسة أن التصميم المخصص للمجموعة النصية يمكنه الحفاظ على أداء تنافسي حتى مع إصدار نماذج متقدمة جديدة.

arxiv arXiv cs.CL · منذ 2 يوم HealthBench · 51.9% · 5 مشاهدات

يتطابق VITA الخاص بمجموعة البيانات أو يتفوق على نماذج اللغات الكبيرة المتقدمة في HealthBench

يحتل VITA، وهو نظام توليد مدعوم بالاسترجاع مصمم للبيئات ذات الدخل المنخفض والمتوسط، المرتبة الأولى في المجموعة الفرعية باللغة الإنجليزية من HealthBench، متفوقًا على GPT-5.4 و o4-mini و Gemini 3.1 Pro و Claude Sonnet 4.6.