Le projet llama.cpp a publié la compilation b10344, qui introduit le support de la Multi-Token Prediction (MTP) spécifiquement pour les modèles Nemotron et Nemotron Nano.
- Ajoute le support MTP pour le modèle Nemotron Nano.
- Introduit la configuration mtp_flags pour le modèle Nemotron.
- Fournit des binaires pour macOS (Apple Silicon et Intel), iOS, Linux (CPU, Vulkan, ROCm, OpenVINO, SYCL), Android, Windows (CPU, CUDA 12/13, Vulkan, OpenCL, OpenVINO, SYCL, HIP) et openEuler.
Cette mise à jour permet aux utilisateurs de tirer parti des capacités MTP avec les modèles Nemotron sur une large gamme de plateformes matérielles et de systèmes d'exploitation.