llama.cpp b10338 릴리스는 공유 전문가 혼합 전문가(MoE) 모델을 저장한 후 로드하는 데 실패하게 만든 모델 저장소의 치명적인 버그를 해결했습니다. 이 문제는 저장소가 `n_ff_chexp` 값을 `LLM_KV_EXPERT_SHARED_FEED_FORWARD_LENGTH` 키에 잘못 작성하여 올바른 텐서 모양 정보를 덮어썼기 때문에 발생했습니다.

  • 수정 사항으로 두 번째 호출이 공유 피드포워드 길이를 덮어쓰는 대신 올바른 `LLM_KV_EXPERT_CHUNK_FEED_FORWARD_LENGTH` 키를 작성하도록 보장합니다.
  • 이는 qwen2moe, qwen3-next, granite-moe, hunyuan-moe, ernie4.5, bailingmoe2, nemotron-h를 포함한 공유 전문가가 있는 아키텍처의 로드 실패를 해결합니다.
  • 이 릴리스에는 macOS(Apple Silicon 및 Intel), iOS, Linux(CPU, Vulkan, ROCm, OpenVINO, SYCL), Android, Windows(CPU, CUDA 12/13, Vulkan, OpenCL, OpenVINO, SYCL, HIP), openEuler용 바이너리가 포함되어 있습니다.

이 수정 사항으로 공유 전문가가 있는 MoE 모델의 저장 및 로드 순환이 텐서 모양 불일치 없이 성공하도록 보장합니다.