Le projet llama.cpp a publié la compilation b11025, qui inclut une extension du support de la Prédiction Multi-Tokens (MTP) de Nemotron.

  • La mise à jour traite la première correction pour cette fonctionnalité et supprime les déclarations inutiles.
  • Des binaires sont fournis pour macOS (Apple Silicon et Intel), iOS, Linux (CPU, Vulkan, CUDA 12/13, ROCm, OpenVINO, SYCL), Android, Windows (CPU, OpenCL, CUDA 12/13, Vulkan, OpenVINO, SYCL, ROCm) et openEuler.
  • Une compilation d'interface utilisateur autonome est également disponible au téléchargement.