Proyek llama.cpp merilis build b10796, yang mencakup perubahan pada pemuat model untuk mendukung model dengan jumlah ahli yang berbeda per lapisan.

  • Menambahkan fungsi `n_expert_used_max` untuk menangani pemeriksaan lapisan ahli selama pemuatan model.
  • Memperbarui `llama_model_base::load_hparams` untuk menggunakan `hparams.n_expert_used_max` alih-alih gagal pada asersi.
  • Memecahkan kesalahan saat memuat model seperti NVIDIA Nemotron-3-Puzzle-75B-A9B yang memiliki konfigurasi ahli tertentu.

Pembaruan ini memungkinkan llama.cpp memuat dan memproses model dengan benar di mana jumlah ahli yang digunakan bervariasi di seluruh lapisan, mencegah kegagalan asersi selama inisialisasi.