تسلط أخبار هذا الأسبوع في مجال الذكاء الاصطناعي الضوء على إصدارات نماذج ذات أوزان مفتوحة من Z.ai وTencent وAlibaba، جنبًا إلى جنب مع تطورات في بنية الاستدلال وتقييم الوكلاء.
- أطلقت Z.ai نموذج GLM-5.3 الذي يحتوي على 744B معلمة إجمالاً للبرمجة الوكيلية والدفاع السيبراني، بينما يوفر متغير Flash جودة أعلى بتكلفة أقل.
- أطلقت Tencent نموذج Hy4-preview، وهو نموذج MoE بحجم 770B يُظهر مكاسب أداء كبيرة مقارنة بـHy3 في مهام توليد الكود.
- قدمت Alibaba نموذج Qwen3.8-Flash، وهو نموذج MoE بحجم 125B مصمم للاستدلال متعدد الوسائط طويل السياق بتكلفة منخفضة، رغم ملاحظة تقارير أولية لمشاكل استقرار مع التكميم FP8.
- نشرت vLLM مقاييس مقارنة لطرق فك التشفير التخميني، ووجدت عدم وجود فائز شامل وأكدت على أهمية ضبط الأداء حسب طبيعة الحمل.
- أطلقت Alibaba Accio منصة CommerceAgentBench مفتوحة المصدر، وهي مقياس يتكون من 107 مهام يقيس إكمال المهام الفعلية بدلاً من جودة الإجابات فقط.
- تشير أبحاث Google إلى أن المهارات المحمولة المخزنة في ويكي دائم تنتقل بفعالية عبر عائلات النماذج، مما قد يوفر قدرات وكيل أكثر متانة مقارنة بالتدريب الدقيق.