أصدر مشروع llama.cpp الإصدار b10796، والذي يتضمن تغييرًا في محمّل النموذج لدعم النماذج ذات الأعداد المختلفة من الخبراء لكل طبقة.

  • يضيف الدالة `n_expert_used_max` للتعامل مع فحوصات طبقات الخبراء أثناء تحميل النموذج.
  • يحدث `llama_model_base::load_hparams` لاستخدام `hparams.n_expert_used_max` بدلاً من فشلAssertions.
  • يحل الأخطاء عند تحميل نماذج مثل NVIDIA Nemotron-3-Puzzle-75B-A9B التي تحتوي على تكوينات خبراء محددة.

يتيح هذا التحديث لـ llama.cpp تحميل ومعالجة النماذج بشكل صحيح حيث يختلف عدد الخبراء المستخدمين عبر الطبقات، مما يمنع فشلAssertions أثناء التهيئة.