llama.cpp プロジェクトはビルド b10796 をリリースしました。これには、レイヤーごとの専門家の数が異なるモデルをサポートするためのモデルローダーの変更が含まれています。
- モデル読み込み中の専門家レイヤーのチェックを処理するために `n_expert_used_max` 関数を追加しました。
- アサート失敗の代わりに `hparams.n_expert_used_max` を使用するように `llama_model_base::load_hparams` を更新しました。
- NVIDIA Nemotron-3-Puzzle-75B-A9B など、特定の専門家構成を持つモデルの読み込み時のエラーを解決しました。
このアップデートにより、llama.cpp はレイヤー間で使用される専門家の数が異なるモデルを正しく読み込み、処理できるようになり、初期化中のアサート失敗を防ぎます。