Proyek qwen4exp telah mengimplementasikan dukungan rollback keadaan rekuren untuk memungkinkan decoding spekulatif Multi-Token Prediction (MTP) yang efektif. Perubahan ini memungkinkan keadaan target mundur sebanyak jumlah token draf yang ditolak, mencegah serialisasi tidak perlu dari seluruh keadaan rekuren ke memori host.
Sebelumnya, fungsi `build_conv_state_at` hanya menulis satu bidang, menyebabkan rollback memulihkan riwayat konvolusi yang tidak lengkap. Pembaruan sekarang menulis satu tangkapan layar per slot untuk QKV delta net dan konvolusi PLE, memastikan pemulihan keadaan yang akurat.
Benchmarks pada Qwen3.8-Flash-Next UD-Q4_K_XL dengan draf MTP menunjukkan kecepatan decoding 183 tok/s untuk kode dan 144 tok/s untuk prosa. Ini adalah peningkatan signifikan dibandingkan metode fallback sebelumnya, yang hanya mencapai 123 dan 83 tok/s masing-masing.