Проект llama.cpp выпустил сборку b10796, которая включает изменение в загрузчике моделей для поддержки моделей с различным количеством экспертов на слой.
- Добавлена функция `n_expert_used_max` для проверки экспертных слоев во время загрузки модели.
- Обновлен `llama_model_base::load_hparams` для использования `hparams.n_expert_used_max` вместо падения проверок.
- Исправлены ошибки при загрузке моделей, таких как NVIDIA Nemotron-3-Puzzle-75B-A9B, имеющих специфические конфигурации экспертов.
Это обновление позволяет llama.cpp корректно загружать и обрабатывать модели, где количество используемых экспертов варьируется по слоям, предотвращая падения проверок во время инициализации.