El proyecto vLLM lanzó la versión 0.28.0rc2, que incluye la función de decodificación especulativa DFlash2.
- DFlash2 implementa un mecanismo de convolución local para la generación eficiente de tokens.
- La actualización introduce un selector de candidatos dedicado para mejorar el proceso de spec decode.
- Este cambio fue cherry-picked del commit b389ac2 y firmado por khluu.