أضاف مشروع llama.cpp الدعم الأولي لهندسة نموذج GLM-5.3-Flash (GLM5-Next)، بما في ذلك الانتقال إلى ذاكرة الفهرس الهجين وقدرات التنبؤ متعدد الرموز (MTP) المبكرة.
- تمت إضافة دعم MTP الأولي، على الرغم من إزالته من طلب السحب الأولي للسماح بمراجعة مركزة.
- يتم الآن الاحتفاظ بتنسيق k-pool عبر ubatches لمنع التقادم بعد تعديلات التسلسل وعمليات التفكيك المشتركة.
- يتم كتابة نقاط التراجع المتكررة بشكل صحيح لحالة conv وحالة delta net.
- تم إصلاح خطأ في stride تدفق build_attn_mha للاستعلامات غير المتصلة، مما يضمن التعبئة المسبق متعددة التدفقات الصحيحة لـ GLM5-Next.
- تم تنظيف مرشحات حماية الكمّية لإزالة الإدخالات المكررة.
تضمن هذه التغييرات استنتاجًا مستقرًا وإدارة حالة صحيحة لنماذج GLM5-Next عبر خلفيات عتاد مختلفة بما في ذلك CUDA و ROCm و CPU.