Le projet llama.cpp a publié la compilation b11025, qui inclut une extension du support de la Prédiction Multi-Tokens (MTP) de Nemotron.
- La mise à jour traite la première correction pour cette fonctionnalité et supprime les déclarations inutiles.
- Des binaires sont fournis pour macOS (Apple Silicon et Intel), iOS, Linux (CPU, Vulkan, CUDA 12/13, ROCm, OpenVINO, SYCL), Android, Windows (CPU, OpenCL, CUDA 12/13, Vulkan, OpenVINO, SYCL, ROCm) et openEuler.
- Une compilation d'interface utilisateur autonome est également disponible au téléchargement.