El proyecto llama.cpp lanzó la compilación b11307, que corrige el orden de entrada de las capas para preservar la secuencia original del lote durante la decodificación especulativa. Este cambio asegura que el orden de los tokens se mantenga correctamente para las incrustaciones NextN no enmascaradas y sea compatible con las divisiones de tensores.
- Restaura el orden original de las filas después de la sincronización copiando los tensores del micro-lote desde el desplazamiento cero.
- Utiliza el mapeo de tokens originales para las filas NextN no enmascaradas, incluso cuando la captura de entrada de la capa está desactivada.
- Corrige problemas de reserva de WebGPU y captura del estado oculto de OpenVINO.
- Se valida en 256 configuraciones de CPU/CUDA/tensores con Qwen3.8-27B completando MT-Bench a una concurrencia de 16.
La actualización garantiza la corrección en los flujos de trabajo de decodificación especulativa al prevenir la corrupción del orden en las entradas de las capas y las incrustaciones.