llama.cpp memperkenalkan dukungan untuk model NVIDIA Nemotron-3-Puzzle-75B-A9B, mengaktifkan inferensi untuk arsitektur Mixture of Experts ini. Pembaruan ini mengimplementasikan infrastruktur untuk ukuran feed-forward ahli per-layer yang bervariasi dan routing top-k, yang diperlukan karena model memiliki 40 lapisan MoE dengan nilai n_ff_exp dan top-k yang berbeda.
- Menambahkan array n_ff_exp dan n_expert_used per-layer dengan kemampuan pemuatan skalar atau array.
- Mengimplementasikan infrastruktur G1/G2 untuk menangani konfigurasi ahli heterogen di seluruh lapisan.
- Memperbarui konverter untuk mengurai block_configs dan menormalisasi nama tensor untuk checkpoint resmi BF16.
- Membedakan Nemotron 3 Puzzle dari varian Super berdasarkan array expert_used_count per-layer.
Perubahan ini memungkinkan llama.cpp memuat dan menjalankan model Nemotron-3-Puzzle, yang sebelumnya tidak didukung karena struktur MoE-nya yang kompleks dan tidak seragam.