Proyek llama.cpp merilis versi b10212, yang mencakup perubahan untuk memuat tensor Multi-Token Prediction (MTP) hanya jika benar-benar digunakan. Pembaruan ini memastikan bahwa tensor MTP dilewati selama pemuatan pada model-model lain yang mendukung fitur tersebut tetapi tidak membutuhkannya.

  • Memuat tensor MTP secara kondisional berdasarkan penggunaan.
  • Lewati pemuatan MTP pada model yang kompatibel di mana hal itu tidak diperlukan.

Optimasi ini mengurangi overhead memori yang tidak perlu untuk model yang tidak memanfaatkan Multi-Token Prediction.