llama.cpp가 NVIDIA Nemotron-3-Puzzle-75B-A9B 모델에 대한 지원을 도입하여 이 Mixture of Experts 아키텍처의 추론을 가능하게 합니다. 이번 업데이트는 모델이 서로 다른 n_ff_exp 및 top-k 값을 가진 40개의 MoE 레이어를 가지고 있기 때문에 필요한 가변 레이어별 전문가 피드포워드 크기 및 top-k 라우팅을 위한 인프라를 구현합니다.
- 스칼라 또는 배열 로딩 기능을 갖춘 레이어별 n_ff_exp 및 n_expert_used 배열 추가.
- 레이어 간 이종 전문가 구성을 처리하기 위한 G1/G2 인프라 구현.
- 공식 BF16 체크포인트에 대한 block_configs 파싱 및 텐서 이름 정규화를 위해 컨버터 업데이트.
- 레이어별 expert_used_count 배열을 기반으로 Nemotron 3 Puzzle과 Super 변형 구분.
이 변경으로 llama.cpp는 복잡하고 비균일한 MoE 구조로 인해 이전에 지원되지 않았던 Nemotron-3-Puzzle 모델을 로드하고 실행할 수 있게 되었습니다.