Proyek llama.cpp telah merilis build b10344, yang memperkenalkan dukungan Multi-Token Prediction (MTP) secara khusus untuk model Nemotron dan Nemotron Nano.

  • Menambahkan dukungan MTP untuk model Nemotron Nano.
  • Memperkenalkan konfigurasi mtp_flags untuk model Nemotron.
  • Menyediakan biner untuk macOS (Apple Silicon dan Intel), iOS, Linux (CPU, Vulkan, ROCm, OpenVINO, SYCL), Android, Windows (CPU, CUDA 12/13, Vulkan, OpenCL, OpenVINO, SYCL, HIP), dan openEuler.

Pembaruan ini memungkinkan pengguna memanfaatkan kemampuan MTP dengan model Nemotron di berbagai platform perangkat keras dan sistem operasi.