أصدر مشروع llama.cpp الإصدار b10760، والذي يتضمن إصلاحات محددة لنموذج Qwen3-tts-0.6B لمنع عدم الاستقرار العددي أثناء الاستنتاج.

  • يعامل محمّل mtmd الآن proj_in لمُتنبئ الكود qwen3-tss كخيار، متوافقًا مع التنفيذ المرجعي حيث يتم حذف هذا الموتر.
  • تم الاحتفاظ بطبقة ffn_down لمُتنبئ الكود بدقة F32 لأن تنشيطاتها تصل إلى ذروة حوالي 1.5e5، متجاوزةً حد F16 وتسبب أخطاء NaN.

تضمن هذه التغييرات أن الرسم البياني يتعامل بشكل صحيح مع الأوزان المفقودة ويمنع تجاوز السعة في الطبقات ذات التنشيط العالي لهذا النقطة المرجعية المحددة.