Le projet llama.cpp a publié la version b11440, qui inclut une correction pour l'initialisation spéculative de MTP. La mise à jour garantit que le planificateur est rérérévé lorsque les drapeaux d'extraction NextN changent, empêchant les problèmes d'extraction non masquée.

  • L'initialisation spéculative de MTP active désormais l'extraction NextN dans les contextes cible et brouillon après la création.
  • Le graphe trunk conserve chaque token jusqu'à la dernière couche au lieu de tronquer aux lignes de sortie.
  • L'invalidation de la réserve lorsque les drapeaux changent permet au prochain calcul de réréserver avec la nouvelle forme du graphe.
  • Les binaires sont disponibles pour macOS, Linux, Windows, Android et iOS via les backends CPU, GPU et NPU.

Ce changement prévient les erreurs GGML_SCHED_DEBUG_REALLOC en garantissant l'allocation correcte de la forme du lot pendant le décodage.