llama.cpp 프로젝트는 Qwen4Exp 모델에 대해 다중 토큰 예측(MTP) 지원을 도입한 빌드 b11330을 출시했습니다. 이 업데이트는 macOS, Linux, Windows, Android 및 iOS용 바이너리를 다양한 하드웨어 백엔드에서 제공하는 더 넓은 릴리스의 일부입니다.
- pull request #29761을 통해 Qwen4Exp 모델에 대한 MTP 기능을 추가합니다.
- `ctx_bufs`가 비어 있지 않은지 확인하는 것을 선호하여 `has_state` 멤버를 제거합니다.
- 일관된 명명 규칙과 주석의 간소화를 포함한 코드 정리 작업을 포함합니다.
- CPU, GPU(CUDA, Vulkan, ROCm, OpenCL) 및 NPU(Snapdragon Hexagon) 타겟을 위한 사전 빌드된 바이너리를 제공합니다.
이 릴리스를 통해 사용자는 기존 하드웨어 구성과의 호환성을 유지하면서 llama.cpp 내에서 MTP 기능을 활용할 수 있습니다.