تقدم llama.cpp دعمًا لنموذج NVIDIA Nemotron-3-Puzzle-75B-A9B، مما يتيح الاستدلال لهذه البنية المكونة من مزيج من الخبراء. تنفذ التحديث بنية أساسية لأحجام التغذية الأمامية للخبراء المتغيرة لكل طبقة وتوجيه top-k، وهو مطلوب لأن النموذج يحتوي على 40 طبقة MoE بقيم مختلفة لـ n_ff_exp و top-k.

  • يضيف مصفوفات n_ff_exp و n_expert_used لكل طبقة مع قدرات تحميل قياسي أو مصفوفة.
  • ينفذ بنية أساسية G1/G2 للتعامل مع تكوينات خبراء غير متجانسة عبر الطبقات.
  • يحدث المحول لتحليل block_configs وتطبيع أسماء الأوتار لنقاط التحقق الرسمية BF16.
  • يميز بين Nemotron 3 Puzzle ومتغيرات Super بناءً على مصفوفة expert_used_count لكل طبقة.

يتيح هذا التغيير لـ llama.cpp تحميل وتشغيل نموذج Nemotron-3-Puzzle، الذي كان ينقصه الدعم سابقًا بسبب بنيته MoE المعقدة وغير الموحدة.