El proyecto llama.cpp lanzó la compilación b10701, que incluye una corrección para los modelos borrador de DFlash2 NVFP4. La actualización aborda un problema en el que estos modelos producían casi ningún token especulativo aceptado.
- Pasa las escalas NVFP4 faltantes a las operaciones de atención en el pull request #28000.
- Asegura que las escalas de proyección Q, K, V y de salida se pasen correctamente a las operaciones de grafo correspondientes.
Este cambio restaura la funcionalidad adecuada para los modelos DFlash2 NVFP4 corrigiendo la propagación de escalas requerida para la decodificación especulativa.