Le projet vLLM a publié la version 0.28.0rc2, qui inclut la fonction de décodage spéculatif DFlash2.

  • DFlash2 implémente un mécanisme de convolution locale pour une génération efficace de tokens.
  • La mise à jour introduit un sélecteur de candidats dédié pour améliorer le processus de spec decode.
  • Ce changement a été cherry-picked depuis le commit b389ac2 et signé par khluu.