llama.cpp 프로젝트는 Multi-Token Prediction (MTP) 초안에서 CUDA graphs 지원을 도입한 버전 b11007을 출시했습니다. 이 업데이트는 CUDA graph 실행을 활용하여 초안 작성 프로세스의 효율성을 향상시킵니다.

  • 사용 효율성을 높이기 위해 MTP 초안에 대해 CUDA graph 활성화.
  • macOS (Apple Silicon 및 Intel), iOS, Linux (CPU, Vulkan, CUDA 12/13, ROCm, OpenVINO, SYCL), Android, Windows (CPU, OpenCL, CUDA 12/13, Vulkan, OpenVINO, SYCL, ROCm) 및 openEuler용 바이너리 제공.
  • 모든 지원 플랫폼에 대한 UI 바이너리 포함.

이 릴리스를 통해 사용자는 새로운 MTP 초안 구현을 통해 호환되는 NVIDIA GPU에서 최적화된 추론 성능의 혜택을 받을 수 있습니다.