El proyecto qwen4exp ha implementado soporte de reversión de estado recurrente para habilitar la descodificación especulativa con predicción multi-tokens (MTP) efectiva. Este cambio permite que el estado objetivo retroceda en el número de tokens borrador rechazados, evitando la serialización innecesaria de todo el estado recurrente a la memoria del host.
Anteriormente, la función `build_conv_state_at` escribía solo una sola capa, lo que provocaba que las reversiones restauraran un historial de convolución incompleto. La actualización ahora escribe una instantánea por ranura tanto para QKV delta net como para las convoluciones PLE, asegurando una restauración precisa del estado.
Las pruebas en Qwen3.8-Flash-Next UD-Q4_K_XL con borrador MTP muestran velocidades de descodificación de 183 tok/s en código y 144 tok/s en prosa. Esto es una mejora significativa respecto al método de respaldo anterior, que solo lograba 123 y 83 tok/s respectivamente.