Le projet llama.cpp a publié la compilation b10344, qui introduit le support de la Multi-Token Prediction (MTP) spécifiquement pour les modèles Nemotron et Nemotron Nano.

  • Ajoute le support MTP pour le modèle Nemotron Nano.
  • Introduit la configuration mtp_flags pour le modèle Nemotron.
  • Fournit des binaires pour macOS (Apple Silicon et Intel), iOS, Linux (CPU, Vulkan, ROCm, OpenVINO, SYCL), Android, Windows (CPU, CUDA 12/13, Vulkan, OpenCL, OpenVINO, SYCL, HIP) et openEuler.

Cette mise à jour permet aux utilisateurs de tirer parti des capacités MTP avec les modèles Nemotron sur une large gamme de plateformes matérielles et de systèmes d'exploitation.