llama.cpp 프로젝트는 레이어당 전문가 수가 다른 모델을 지원하기 위해 모델 로더에 변경 사항을 포함하는 빌드 b10796을 출시했습니다.

  • 모델 로딩 중 전문가 레이어 검사를 처리하기 위해 `n_expert_used_max` 함수를 추가했습니다.
  • 어설션 실패 대신 `hparams.n_expert_used_max`를 사용하도록 `llama_model_base::load_hparams`를 업데이트했습니다.
  • NVIDIA Nemotron-3-Puzzle-75B-A9B와 같이 특정 전문가 구성을 가진 모델을 로딩할 때 발생하는 오류를 해결했습니다.

이 업데이트로 인해 llama.cpp는 레이어 간에 사용되는 전문가 수가 다른 모델을 올바르게 로딩하고 처리할 수 있으며, 초기화 중 어설션 실패를 방지합니다.