نشر فريق GLM منشورًا على مدونة z.ai يوضح بنية وتصميم بنيتها التحتية للاستدلال.
- يقدم المقال نظرة تقنية متعمقة حول كيفية تعامل GLM مع خدمة النماذج وتحسينها.
- يُوصف بأنه «قراءة مثيرة للغاية» لأولئك المهتمين بأنظمة نشر نماذج اللغة الكبيرة.
نشر فريق GLM منشورًا على مدونة z.ai يوضح بنية وتصميم بنيتها التحتية للاستدلال.
أصدرت Z.ai نموذج GLM-5.3-Flash، وهو نموذج MoE متعدد الوسائط يحتوي على 320 مليار معامل مع 18 مليار معامل نشط، بينما أصدر فريق Qwen التابع لـ Alibaba نموذج Qwen3.8-Flash-Next، وهو نموذج بحجم 125 مليار معامل مع 6 مليارات معامل نشط. وعلى الرغم من التطوير المستقل، اعتمد الفريقان تكوينات معمارية متطابقة تقريباً.
تكشف دراسة شملت ثمانية نماذج أن الذاكرة الوكيلية ليست سمة عالمية، بل جرعة يجب ضبطها لتناسب قدرة النموذج المحدد. يستخلص إطار عمل ALTK-Evolve إرشادات من المسارات السابقة للوكيل ويحقنها أثناء الاستدلال دون تحديث الأوزان، مما يُظهر أن استراتيجيات الذاكرة المثلى تختلف بشكل كبير عبر مستويات النماذج.
أصدر مشروع llama.cpp الإصدار b10174، مقدمًا دعم فك التشفير التكهن NextN/MTP لهيكل نموذج GLM_DSA (GLM-5.2).
PIVOT (الفهرسة الوسيطة عبر اجتياز بادئة كاملة) هي بديل جاهز للاستخدام لا يتطلب تدريبًا، لفهرس DeepSeek Sparse Attention (DSA)، ويقلل من التكرار الحسابي عن طريق مشاركة مسح بادئة واحدة عبر مجموعة من الاستعلامات القريبة. وبدلاً من تقييم كل رمز سابق لكل استعلام على حدة، تجمع PIVOT المجموعة في استعلام وسيط واحد للحصول على مجموعة مرشحة، يتم منها اختيار أفضل k رموز لكل استعلام.
قام مستخدم بضغط نموذج GLM-5.2 (753B MoE) إلى Int4-Int8Mix مع ذاكرة تخزين مؤقت KV بـ NVFP4 4-bit وشغّله على أربعة أنظمة DGX Spark (GB10)، محققاً نتيجة 70.8% على Terminal-Bench 2.1.
نستخدم ملفات تعريف الارتباط لقياس الزيارات وتحسين الموقع. يمكنك قبول أو رفض ملفات تعريف الارتباط الخاصة بالتحليلات. سياسة الخصوصية