llama.cpp 프로젝트는 GLM_DSA (GLM-5.2) 모델 아키텍처를 위한 NextN/MTP 추측 디코딩 지원을 도입하는 빌드 b10174을 출시했습니다.

  • --spec-type draft-mtp 대상으로 GLM-5.2 NextN/MTP를 추가하여 밀집 MLA 어텐션 및 MTP 컨텍스트 KV 설정을 활성화합니다.
  • GlmMoeDsaForCausalLM에 대한 --mtp/--no-mtp 내보내기를 지원하도록 변환 스크립트를 업데이트하여 사용자가 내보내기 동안 NextN 블록을 제거하거나 유지할 수 있도록 합니다.
  • macOS (Apple Silicon 및 Intel), Linux (CPU, Vulkan, ROCm, OpenVINO, SYCL), Android, Windows (CPU, CUDA 12/13, Vulkan, OpenCL, ROCm, SYCL) 및 openEuler 플랫폼에 대한 사전 빌드된 바이너리를 제공합니다.

이 업데이트는 llama.cpp 프레임워크 내에서 추측 디코딩 기술을 활용하여 GLM-5.2 모델의 더 빠른 추론 속도를 가능하게 합니다.