أصدر مختبر خوارزميات ISTA العميق والأنظمة إصدارات GGUF المُكمّاة للنموذج ذو الخبراء المتناثرين Qwen3.8-Flash-Next، جنباً إلى جنب مع بناء تجريبي مستهدف القدرات تمت إزالة نصف خبراءه.

  • يتضمن الإصدار أربعة نماذج GGUF مُكمّاة تتراوح بين 2.40 و3.50 بت لكل معامل (66.4 إلى 83.6 جيجابايت) باستخدام تقنيات GSQ وRCO.
  • عند مستوى 3.50 بت لكل معامل، يتطابق النموذج مع الأساس BF16 في كل المعايير المُقيّمة، بما في ذلك GPQA-Diamond وLiveCodeBench v6.
  • يزيل بناء Coder المقتطع 256 من أصل 512 خبيراً موجهاً لكل طبقة، مما يؤدي إلى متوسط عرض بت يبلغ 1.89 بت لكل معامل.
  • يقلل هذا الاقتطاع مجموعة العمل المقيمة إلى 29.6 جيجابايت، مما يسمح للنموذج ذي الـ176.9 مليار معامل بالاحتواء داخل مسرّع واحد سعة 32 جيجابايت.

تحافظ النماذج المُكمّاة على أداء عالٍ بالنسبة لحجمها، بينما يحتفظ بناء Coder المقتطع بـ91.3% من درجات SWE-bench Verified و98.7% من درجات LiveCodeBench v6 مقارنةً بالأساس BF16.