Le projet qwen4exp a implémenté la prise en charge du retour arrière d'état récurrent pour permettre un décodage spéculatif Multi-Token Prediction (MTP) efficace. Ce changement permet à l'état cible de reculer du nombre de tokens de brouillon rejetés, évitant ainsi la sérialisation inutile de tout l'état récurrent vers la mémoire hôte.

Auparavant, la fonction `build_conv_state_at` n'écrivait qu'un seul plan, ce qui provoquait la restauration d'un historique de convolution incomplet lors des retours arrière. La mise à jour écrit désormais une capture par emplacement pour le delta net QKV et les convolutions PLE, garantissant une restauration précise de l'état.

Les benchmarks sur Qwen3.8-Flash-Next UD-Q4_K_XL avec brouillon MTP montrent des vitesses de décodage de 183 tok/s pour le code et 144 tok/s pour la prose. Il s'agit d'une amélioration significative par rapport à la méthode de repli précédente, qui n'atteignait que 123 et 83 tok/s respectivement.