Le projet vLLM a publié la version 0.28.0rc2, qui inclut la fonction de décodage spéculatif DFlash2.
- DFlash2 implémente un mécanisme de convolution locale pour une génération efficace de tokens.
- La mise à jour introduit un sélecteur de candidats dédié pour améliorer le processus de spec decode.
- Ce changement a été cherry-picked depuis le commit b389ac2 et signé par khluu.