Proyek llama.cpp merilis build b11307, yang memperbaiki urutan input lapisan untuk mempertahankan urutan batch asli selama decoding spekulatif. Perubahan ini memastikan bahwa urutan token dipertahankan dengan benar untuk embedding NextN yang tidak dimask dan kompatibel dengan pemisahan tensor.

  • Memulihkan urutan baris asli setelah sinkronisasi dengan menyalin tensor microbatch dari offset nol.
  • Menggunakan pemetaan token asli untuk baris NextN yang tidak dimask, bahkan ketika penangkapan input lapisan dinonaktifkan.
  • Memperbaiki masalah reservasi WebGPU dan penangkapan keadaan tersembunyi OpenVINO.
  • Divalidasi di 256 konfigurasi CPU/CUDA/tensor dengan Qwen3.8-27B menyelesaikan MT-Bench pada konkurensi 16.

Pembaruan ini memastikan kebenaran dalam alur kerja decoding spekulatif dengan mencegah kerusakan urutan pada input lapisan dan embedding.