Proyek llama.cpp telah merilis build b10344, yang memperkenalkan dukungan Multi-Token Prediction (MTP) secara khusus untuk model Nemotron dan Nemotron Nano.
- Menambahkan dukungan MTP untuk model Nemotron Nano.
- Memperkenalkan konfigurasi mtp_flags untuk model Nemotron.
- Menyediakan biner untuk macOS (Apple Silicon dan Intel), iOS, Linux (CPU, Vulkan, ROCm, OpenVINO, SYCL), Android, Windows (CPU, CUDA 12/13, Vulkan, OpenCL, OpenVINO, SYCL, HIP), dan openEuler.
Pembaruan ini memungkinkan pengguna memanfaatkan kemampuan MTP dengan model Nemotron di berbagai platform perangkat keras dan sistem operasi.