Proyek llama.cpp merilis versi b10212, yang mencakup perubahan untuk memuat tensor Multi-Token Prediction (MTP) hanya jika benar-benar digunakan. Pembaruan ini memastikan bahwa tensor MTP dilewati selama pemuatan pada model-model lain yang mendukung fitur tersebut tetapi tidak membutuhkannya.
- Memuat tensor MTP secara kondisional berdasarkan penggunaan.
- Lewati pemuatan MTP pada model yang kompatibel di mana hal itu tidak diperlukan.
Optimasi ini mengurangi overhead memori yang tidak perlu untuk model yang tidak memanfaatkan Multi-Token Prediction.