El proyecto llama.cpp ha lanzado la versión b11007, que introduce soporte para CUDA graphs en borradores de Multi-Token Prediction (MTP). Esta actualización mejora la eficiencia del proceso de borrado aprovechando la ejecución de CUDA graph.

  • Habilitar CUDA graph para el borrador de MTP para mejorar la eficiencia de uso.
  • Proporcionar binarios para macOS (Apple Silicon e Intel), iOS, Linux (CPU, Vulkan, CUDA 12/13, ROCm, OpenVINO, SYCL), Android, Windows (CPU, OpenCL, CUDA 12/13, Vulkan, OpenVINO, SYCL, ROCm) y openEuler.
  • Incluir binarios de UI para todas las plataformas compatibles.

Esta versión permite a los usuarios beneficiarse del rendimiento de inferencia optimizado en GPUs NVIDIA compatibles a través de la nueva implementación de borrador MTP.