أضاف مشروع llama.cpp دعمًا لبنية نموذج Qwen3.8-Flash-Next (qwen4exp)، بتنفيذ مكوناته المحددة بما في ذلك الوصلات الفائقة، وشبكات دلتا ذات البوابات، وخلط الخبراء، وتضمينات التجزئة n-gram لـ PLE.
- يضيف أنابيب GGUF لـ qwen4_exp، بما في ذلك موترات للوصلات الفائقة منخفضة الرتبة وتضمينات PLE.
- يطبق رسم التحليل مع تدفقات المتبقي للوصلات الفائقة وكتل MoE، وتم التحقق منه مقابل vLLM بتوافق عالٍ في top-1.
- يقدم تجزئة جانب المضيف لتضمينات n-gram لـ PLE باستخدام أعداد صحيحة 64-bit بسبب قيم المضاعفات الكبيرة.
- يضيف دعمًا اختياريًا لخزان مفاتيح المؤشر في llama_memory_hybrid لتمكين الانتباه المتناثر QSA للنماذج الهجينة.
يتيح هذا الإضافة تحميل واستنتاج نماذج Qwen3.8-Flash-Next داخل llama.cpp، مما يوسع تغطية بنيته.