O projeto llama.cpp lançou a versão b11007, que introduz suporte para CUDA graphs em rascunhos de Multi-Token Prediction (MTP). Esta atualização melhora a eficiência do processo de rascunho ao aproveitar a execução de CUDA graph.

  • Habilitar CUDA graph para o rascunho de MTP para melhorar a eficiência de uso.
  • Fornecer binários para macOS (Apple Silicon e Intel), iOS, Linux (CPU, Vulkan, CUDA 12/13, ROCm, OpenVINO, SYCL), Android, Windows (CPU, OpenCL, CUDA 12/13, Vulkan, OpenVINO, SYCL, ROCm) e openEuler.
  • Incluir binários de UI para todas as plataformas suportadas.

Este lançamento permite que os usuários se beneficiem do desempenho de inferência otimizado em GPUs NVIDIA compatíveis por meio da nova implementação de rascunho MTP.