أضاف مشروع llama.cpp دعمًا لبنية نموذج Qwen3.8-Flash-Next (qwen4exp)، بتنفيذ مكوناته المحددة بما في ذلك الوصلات الفائقة، وشبكات دلتا ذات البوابات، وخلط الخبراء، وتضمينات التجزئة n-gram لـ PLE.

  • يضيف أنابيب GGUF لـ qwen4_exp، بما في ذلك موترات للوصلات الفائقة منخفضة الرتبة وتضمينات PLE.
  • يطبق رسم التحليل مع تدفقات المتبقي للوصلات الفائقة وكتل MoE، وتم التحقق منه مقابل vLLM بتوافق عالٍ في top-1.
  • يقدم تجزئة جانب المضيف لتضمينات n-gram لـ PLE باستخدام أعداد صحيحة 64-bit بسبب قيم المضاعفات الكبيرة.
  • يضيف دعمًا اختياريًا لخزان مفاتيح المؤشر في llama_memory_hybrid لتمكين الانتباه المتناثر QSA للنماذج الهجينة.

يتيح هذا الإضافة تحميل واستنتاج نماذج Qwen3.8-Flash-Next داخل llama.cpp، مما يوسع تغطية بنيته.