تم إطلاق أربعة نماذج لغوية كبيرة في الصين خلال الشهر الماضي: Kimi K3-2.8T وQwen3.8-2.4T وDeepSeek-V4-Pro-0813-1.6T وGLM-5.3-743B.
إطلاق Kimi K3 وQwen3.8 وDeepSeek-V4-Pro-0813 وGLM-5.3 خلال شهر
xAI تطلق Grok 4.6؛ أليباबा تفتح Qwen3.8-MoE؛ DeepSeek V4 GA
تسلط أخبار هذا الأسبوع في مجال الذكاء الاصطناعي الضوء على الإصدارات الرئيسية من xAI وأليباوبا وDeepSeek، بالإضافة إلى تحديثات لنماذج الفيديو المفتوحة والبنية التحتية للاستدلال.
Thinking Machines تطلق Inkling، وTencent تحدث Hy3 برخصة Apache 2.0
يبرز أحدث ملخص لنتائج النماذج المفتوحة الإصدارات المهمة من Thinking Machines وTencent، بالإضافة إلى التحديثات من Poolside وDeepSeek.
إصدار Qwen3.8 بوزن مفتوح، وكيماي كود CLI، ومجموعة نتفليكس لنماذج اللغات الكبيرة، وبرمجيات شريحة علي بابا
أعلنت علي بابا عن إصدار Qwen3.8 بوزن مفتوح، وهو نموذج يحتوي على 2.4 تريليون معلمة، كما فتحت مصدر مجموعة برمجيات الشريحة Zhenwu الخاصة بها لتقليل الاعتماد على بيئة CUDA من إنفيديا.
مقارنة بين Kimi K3 وDeepSeek V4 Pro وGLM-5.2 من حيث المقاييس، الترخيص، وتكلفة التشغيل
تُقيّم مقارنة ثلاثة نماذج مفتوحة الوزن من نوع Mixture-of-Experts ذات بنية متفرقة—وهي Kimi K3 من Moonshot AI، وDeepSeek V4 Pro، وGLM-5.2 من Zhipu AI—قدراتها وشروط ترخيصها وتكاليف تشغيلها لأعمال البرمجة طويلة المدى وأعباء العمل الوكيلية.
تقطير deepseek-r1:8B إلى Qwen3-0.6B يتيح إثراء النص الهيكلي السريع على الجهاز
يُظهر الباحثون أن تقطير معلم استدلال بحجم 8 مليارات (deepseek-r1:8B) إلى نموذج طالب بحجم 0.6 مليار (Qwen3-0.6B عبر QLoRA) يتيح استخراجاً هيكلياً عالي الحجم بزمن استجابة وتكلفة أقل بشكل كبير. تقيّم الدراسة هذا النهج في رسم خرائط مقالات الأخبار إلى كائنات JSON تحتوي على ملخصات وعلامات فئوية، وتقارن النموذج المقطّر مع خطوط الأساس للبرمجة القليلة (few-shot prompting) والفك المقيد.