El proyecto vLLM lanzó la versión 0.28.0rc2, que incluye la función de decodificación especulativa DFlash2.

  • DFlash2 implementa un mecanismo de convolución local para la generación eficiente de tokens.
  • La actualización introduce un selector de candidatos dedicado para mejorar el proceso de spec decode.
  • Este cambio fue cherry-picked del commit b389ac2 y firmado por khluu.