تسلط أخبار هذا الأسبوع في مجال الذكاء الاصطناعي الضوء على إصدارات نماذج ذات أوزان مفتوحة من Z.ai وTencent وAlibaba، جنبًا إلى جنب مع تطورات في بنية الاستدلال وتقييم الوكلاء.

  • أطلقت Z.ai نموذج GLM-5.3 الذي يحتوي على 744B معلمة إجمالاً للبرمجة الوكيلية والدفاع السيبراني، بينما يوفر متغير Flash جودة أعلى بتكلفة أقل.
  • أطلقت Tencent نموذج Hy4-preview، وهو نموذج MoE بحجم 770B يُظهر مكاسب أداء كبيرة مقارنة بـHy3 في مهام توليد الكود.
  • قدمت Alibaba نموذج Qwen3.8-Flash، وهو نموذج MoE بحجم 125B مصمم للاستدلال متعدد الوسائط طويل السياق بتكلفة منخفضة، رغم ملاحظة تقارير أولية لمشاكل استقرار مع التكميم FP8.
  • نشرت vLLM مقاييس مقارنة لطرق فك التشفير التخميني، ووجدت عدم وجود فائز شامل وأكدت على أهمية ضبط الأداء حسب طبيعة الحمل.
  • أطلقت Alibaba Accio منصة CommerceAgentBench مفتوحة المصدر، وهي مقياس يتكون من 107 مهام يقيس إكمال المهام الفعلية بدلاً من جودة الإجابات فقط.
  • تشير أبحاث Google إلى أن المهارات المحمولة المخزنة في ويكي دائم تنتقل بفعالية عبر عائلات النماذج، مما قد يوفر قدرات وكيل أكثر متانة مقارنة بالتدريب الدقيق.