O projeto llama.cpp lançou a compilação b11307, que corrige a ordem de entrada das camadas para preservar a sequência original do lote durante a decodificação especulativa. Esta alteração garante que a ordem dos tokens seja mantida corretamente para os embeddings NextN não mascarados e seja compatível com divisões de tensores.

  • Restaura a ordem original das linhas após a sincronização, copiando tensores do micro-lote a partir do deslocamento zero.
  • Usa o mapeamento de tokens originais para as linhas NextN não mascaradas, mesmo quando a captura de entrada da camada está desativada.
  • Corrige problemas de reserva do WebGPU e captura do estado oculto do OpenVINO.
  • Validado em 256 configurações de CPU/CUDA/tensores com Qwen3.8-27B completando o MT-Bench com concorrência 16.

A atualização garante a correção nos fluxos de trabalho de decodificação especulativa, impedindo a corrupção da ordem nas entradas das camadas e nos embeddings.