O projeto qwen4exp implementou suporte a rollback de estado recorrente para habilitar a decodificação especulativa Multi-Token Prediction (MTP) eficaz. Esta alteração permite que o estado alvo retroceda pelo número de tokens rascunho rejeitados, evitando a serialização desnecessária de todo o estado recorrente para a memória do host.

Anteriormente, a função `build_conv_state_at` gravava apenas um único plano, fazendo com que os rollbacks restaurassem um histórico de convolução incompleto. A atualização agora grava uma captura por slot tanto para QKV delta net quanto para convoluções PLE, garantindo uma restauração precisa do estado.

Os benchmarks no Qwen3.8-Flash-Next UD-Q4_K_XL com rascunho MTP mostram velocidades de decodificação de 183 tok/s em código e 144 tok/s em prosa. Isso é uma melhoria significativa em relação ao método de fallback anterior, que alcançava apenas 123 e 83 tok/s respectivamente.