أصدر مشروع llama.cpp الإصدار b10212، والذي يتضمن تغييرًا لتحميل موترات Multi-Token Prediction (MTP) فقط إذا كانت مستخدمة فعليًا. يضمن هذا التحديث تخطي تحميل موترات MTP أثناء التحليل للنماذج المتبقية التي تدعم الميزة ولكن لا تحتاج إليها.

  • تحميل موترات MTP بشكل مشروط بناءً على الاستخدام.
  • تخطي تحميل MTP في النماذج المدعومة حيث لا يكون ذلك ضروريًا.

يقلل هذا التحسين من الحمل غير الضروري للذاكرة للنماذج التي لا تستخدم Multi-Token Prediction.