llama.cpp 프로젝트는 Nemotron-H 모델의 치명적인 로딩 시간 충돌을 해결하는 버전 b10947을 출시했습니다. 이 업데이트는 NextN/MTP 꼬리 루프가 비-MoE 레이어에 대해 제로 값을 보유하는 레이어별 배열에서 전문가 FFN 크기를 유도할 때 발생하는 제로 디바이더 오류를 방지합니다.

  • expert_feed_forward_length가 누락된 경우 제로로 나누는 대신 잘못된 메타데이터를 보고하여 SIGFPE 충돌을 수정합니다.
  • macOS(Apple Silicon 및 Intel), iOS, Linux(CPU, Vulkan, ROCm, OpenVINO, SYCL), Android, Windows(CPU, CUDA 12/13, OpenCL, Vulkan, OpenVINO, SYCL, ROCm) 및 openEuler에 대한 바이너리를 제공합니다.

이 변경은 체크포인트 로딩 중 시그널 오류로 인해 애플리케이션이 종료되는 것을 방지하여 혼합 MoE 및 밀집 레이어가 있는 모델의 안정적인 작동을 보장합니다.