Le projet llama.cpp a publié la compilation b11307, qui corrige l'ordre des entrées des couches pour préserver la séquence de lot originale lors du décodage spéculatif. Ce changement garantit que l'ordre des tokens est correctement maintenu pour les embeddings NextN non masqués et compatible avec les divisions de tenseurs.

  • Restaure l'ordre original des lignes après synchronisation en copiant les tenseurs du micro-lot à partir du décalage zéro.
  • Utilise la mappage des tokens originaux pour les lignes NextN non masquées, même lorsque la capture des entrées de couche est désactivée.
  • Corrige les problèmes de réservation WebGPU et de capture de l'état caché OpenVINO.
  • Validé sur 256 configurations CPU/CUDA/tenseurs avec Qwen3.8-27B terminant MT-Bench à une concurrence de 16.

La mise à jour garantit la correction dans les flux de travail de décodage spéculatif en empêchant la corruption de l'ordre des entrées de couches et des embeddings.