llama.cpp 프로젝트는 멀티백엔드 환경에서 대규모 Mixture of Experts (MoE) 모델을 로드할 때 발생하는 안정성 문제를 해결한 버전 b10247을 출시했습니다. 이 업데이트는 30개 이상의 입력 텐서를 초과하는 그래프 분할을 처리하기 위해 백엔드 스케줄러의 고정 크기 배열을 동적으로 할당된 버퍼로 대체합니다.

  • 분할 그래프 입력에 대해 GGML_SCHED_MAX_SPLIT_INPUTS를 동적 할당으로 대체합니다.
  • Gemma 4, Qwen MoE, Mixtral, DeepSeek와 같은 넓은 MoE 모델을 로드할 때 발생하는 충돌을 수정합니다.
  • 고정 상수 대신 실제 입력 개수를 사용하도록 graph_size 계산을 업데이트합니다.
  • macOS(Apple Silicon/Intel), Linux(CPU/Vulkan/ROCm/OpenVINO/SYCL), Windows(CPU/CUDA/Vulkan/OpenVINO/SYCL/HIP), Android, iOS용 바이너리를 제공합니다.

이 변경으로 사용자는 여러 백엔드 장치가 있는 시스템에서 스케줄러 관련 충돌 없이 복잡한 MoE 아키텍처를 실행할 수 있습니다.