أصدر مشروع llama.cpp الإصدار b10212، والذي يتضمن تغييرًا لتحميل موترات Multi-Token Prediction (MTP) فقط إذا كانت مستخدمة فعليًا. يضمن هذا التحديث تخطي تحميل موترات MTP أثناء التحليل للنماذج المتبقية التي تدعم الميزة ولكن لا تحتاج إليها.
- تحميل موترات MTP بشكل مشروط بناءً على الاستخدام.
- تخطي تحميل MTP في النماذج المدعومة حيث لا يكون ذلك ضروريًا.
يقلل هذا التحسين من الحمل غير الضروري للذاكرة للنماذج التي لا تستخدم Multi-Token Prediction.