O projeto vLLM lançou a versão 0.28.0rc2, que inclui o recurso de decodificação especulativa DFlash2.
- DFlash2 implementa um mecanismo de convolução local para geração eficiente de tokens.
- A atualização introduz um seletor de candidatos dedicado para melhorar o processo de spec decode.
- Esta alteração foi cherry-picked do commit b389ac2 e assinada por khluu.