إعدادا واجهة برمجة التطبيقات ضاعفا نتائج GPT-5.6 على ARC-AGI-3
أدى تمكين إعدادين محددين لواجهة برمجة التطبيقات لـ GPT-5.6 إلى مضاعفة نتائج أدائه ثلاث مرات على معيار ARC-AGI-3.
أدى تمكين إعدادين محددين لواجهة برمجة التطبيقات لـ GPT-5.6 إلى مضاعفة نتائج أدائه ثلاث مرات على معيار ARC-AGI-3.
أعلنت Z.ai عن GLM-5.3، وهو نموذج جديد يحقق أداءً متقدمًا في معايير برمجة الوكلاء من خلال توسيع تدريب ما بعد النموذج الأساسي GLM-5.2. يتفوق النموذج ذو ~750B معلمة حاليًا على Kimi K3 ويساوي أو يتجاوز Claude Fable 5 و GPT-5.6-Sol في معايير مختلفة.
يكشف مقارنة بين DeepSeek-V4 Flash 0731 وGPT-5.6 Luna على معيار DeepSWE أن GPT-5.6 Luna هو المهندس الأقوى، إلا أن استراتيجية التسلسل التي تستخدم كلا النموذجين تحقق دقة أعلى بتكلفة أقل.
أعلنت أليبابا عن Qwen3.8-Max كنموذجها الرائد الجديد، واصفة إياه بأنه بنية متفرغة تحتوي على 2.4T معلمة تركز على العمل الوكيل طويل المدى، والبرمجة، والاستدلال متعدد الوسائط. وأكدت الشركة أن الأوزان المفتوحة لـ Qwen3.8-Max ستُطلق الأسبوع المقبل جنباً إلى جنب مع النسخة ذات الأوزان المفتوحة Qwen3.8-27B.
قامت DeepSeek بتحديث نموذجها V4 Flash، بإصدار نسخة جديدة في 2026-07-31 تُظهر مكاسب أداء كبيرة مقارنة بالإصدار التجريبي السابق. يُدخل التحديث نتائج لمعايير تقييم جديدة بينما يحسّن النتائج على المعايير الحالية.
تكشف مقارنة بين كيمي K3 وجي بي تي-5.6 سول على معيار DeepSWE أنه بينما يتصدر جي بي تي-5.6 سول في جودة المحاولة الواحدة (72.7% مقابل 68.5%)، يحقق كيمي K3 نتائج أعلى في درجات pass@k لـ k > 1 بتكلفة أقل بكثير.
أطلقت أنثروبيك نموذج كلود أوبوس 5، مما أدى إلى تدقيق أدائه في مقاييس البرمجة والقدرات العامة، بالإضافة إلى تجديد النقاش حول تقييم النماذج المتقدمة.
أطلقت أنثروبيك نموذج كلود أوبوس 5، وهو نموذج حدودي جديد أثار نقاشاً كبيراً حول نتائج الاختبارات والأداء العملي. أفادت التقييمات المستقلة من Epoch AI بأن مؤشر قدرات Epoch (ECI) للنموذج الجديد يبلغ 159، ومؤشر SWE-ECI يبلغ 161.
يحقق Kimi K3، وهو نموذج ذو أوزان مفتوحة من Moonshot AI، أداءً مماثلاً لـ Claude Fable 5 من Anthropic على معيار DeepSWE بينما تكلفته أقل بكثير لكل مهمة. في تقييم بتاريخ 16 يوليو 2026، وصل Kimi K3 إلى نسبة نجاح 68.5% في pass@1 مقارنة بـ 69.9% لـ Fable 5، لكنه تفوق عليه في السيناريوهات متعددة المحاولات وقدم كفاءة تكلفة أعلى.
أصدرت Sierra Research الإصدار τ-bench 1.0.1، الذي يصحح مخطط تقييم مهمة `banking_knowledge` لوقف معاقبة الوكلاء على قراءات التحقق الحذرة، ويُصلح عدة تناقضات في البيانات. يضمن التحديث أن إعادة التقييم لمسارات لوحة المتصدرين تزيد الدرجات فقط، دون فشل أي محاكاة كانت قد نجحت سابقاً.
في 16 يوليو، أطلقت Moonshot AI أحدث طراز لها، Kimi K3، وهو بنية Mixture of Experts (MoE) تحتوي على 2.8 تريليون معلمة. وعدت الشركة بنشر أوزان النموذج في 27 يوليو.
أطلقت مونشوت كيمي K3، وهو نموذج مفتوح الأوزان أحدث إعادة تقييم لقرب النماذج الصينية من الطليعة. يتميز الإصدار بأداء قوي في البرمجة، والمهام الوكيلية، وأعمال المعرفة طويلة المدى.
أعلنت Moonshot AI عن إطلاق Kimi K3، وهو نموذج جديد من فئة الحدود المفتوحة الأوزان، يتميز بـ 2.8 تريليون معلمة إجمالاً وقدرات إدخال متعددة الوسائط بشكل أصيل. يُصنّف رسمياً تحت مسمى "ذكاء الحدود المفتوح"، ويدعم نافذة سياق بحجم مليون توكن، ويستفيد من مكونات معمارية مبتكرة مثل Kimi Delta Attention (KDA) وAttention Residuals لتعزيز الكفاءة.
أعلنت مختبر الذكاء الاصطناعي الصيني Moonshot AI عن Kimi K3، واصفة إياه بأنه أقوى نموذج لديها حتى الآن مع 2.8 تريليون معلمة. يتوفر النموذج حاليًا عبر الموقع الإلكتروني وواجهة برمجة التطبيقات (API)، مع وعد بإصدار الأوزان المفتوحة بحلول 27 يوليو 2026.
يحقق DharmaOCR جودة استخراج واستقرار أعلى من Mistral OCR4 وUnlimited-OCR في البرتغالية البرازيلية من خلال التدريب المخصص للمجال.
أطلقت Qwen نموذج Qwen3.8-27B، المتاح للتحميل على ModelScope وHugging Face.
تسلط المقالة الضوء على رسم بياني من تحديث Gemini 3.7 Flash يُظهر أن الإصدارات السابقة، وتحديداً 3.5 و 3.6 Flash، قد تأخرت مقارنة بنماذج السلاسل الأحدث Claude 4.8+ و GPT 5.5+.
يبرز مستخدم في Reddit نموذج DeepSeek DSv4 Flash 0731، مشيراً إلى قدراته القوية في الأداء مقارنة بتكلفته. يشير المنشور إلى Artificial Analysis Intelligence Index v4.1.1 لدعم الادعاء بأن النموذج يؤدي أداءً استثنائياً.
تم تقييم نظام مُصمم خصيصًا لتوليد النصوص المعزز بالاسترجاع يُدعى VITA، والمُعدّ للبيئات ذات الدخل المنخفض والمتوسط، مقابل نماذج لغوية كبيرة لأغراض عامة على معيار HealthBench. تُظهر الدراسة أن التصميم المخصص للمجموعة النصية يمكنه الحفاظ على أداء تنافسي حتى مع إصدار نماذج متقدمة جديدة.
يحتل VITA، وهو نظام توليد مدعوم بالاسترجاع مصمم للبيئات ذات الدخل المنخفض والمتوسط، المرتبة الأولى في المجموعة الفرعية باللغة الإنجليزية من HealthBench، متفوقًا على GPT-5.4 و o4-mini و Gemini 3.1 Pro و Claude Sonnet 4.6.