O projeto vLLM lançou a versão 0.28.0rc2, que inclui o recurso de decodificação especulativa DFlash2.

  • DFlash2 implementa um mecanismo de convolução local para geração eficiente de tokens.
  • A atualização introduz um seletor de candidatos dedicado para melhorar o processo de spec decode.
  • Esta alteração foi cherry-picked do commit b389ac2 e assinada por khluu.