تقدم llama.cpp دعمًا لنموذج NVIDIA Nemotron-3-Puzzle-75B-A9B، مما يتيح الاستدلال لهذه البنية المكونة من مزيج من الخبراء. تنفذ التحديث بنية أساسية لأحجام التغذية الأمامية للخبراء المتغيرة لكل طبقة وتوجيه top-k، وهو مطلوب لأن النموذج يحتوي على 40 طبقة MoE بقيم مختلفة لـ n_ff_exp و top-k.
- يضيف مصفوفات n_ff_exp و n_expert_used لكل طبقة مع قدرات تحميل قياسي أو مصفوفة.
- ينفذ بنية أساسية G1/G2 للتعامل مع تكوينات خبراء غير متجانسة عبر الطبقات.
- يحدث المحول لتحليل block_configs وتطبيع أسماء الأوتار لنقاط التحقق الرسمية BF16.
- يميز بين Nemotron 3 Puzzle ومتغيرات Super بناءً على مصفوفة expert_used_count لكل طبقة.
يتيح هذا التغيير لـ llama.cpp تحميل وتشغيل نموذج Nemotron-3-Puzzle، الذي كان ينقصه الدعم سابقًا بسبب بنيته MoE المعقدة وغير الموحدة.