Le projet llama.cpp a publié la version b10212, qui inclut une modification pour charger les tenseurs Multi-Token Prediction (MTP) uniquement s'ils sont réellement utilisés. Cette mise à jour garantit que les tenseurs MTP sont ignorés lors du chargement des modèles restants qui prennent en charge la fonctionnalité mais n'en ont pas besoin.
- Charger les tenseurs MTP de manière conditionnelle selon l'utilisation.
- Ignorer le chargement de MTP dans les modèles compatibles où il n'est pas nécessaire.
Cette optimisation réduit la surcharge mémoire inutile pour les modèles qui n'utilisent pas Multi-Token Prediction.