A Liquid AI lançou checkpoints de modelos rascunho DSpark para três modelos de sua família LFM2.5: LFM2.5-1.2B-Instruct, LFM2.5-2.6B e LFM2.5-8B-A1B. Esses geradores de rascunho adicionam um caminho de decodificação especulativa aos modelos alvo existentes, permitindo que um rascunho de aproximadamente 300M parâmetros proponha um bloco de nove tokens candidatos que o modelo alvo verifica em uma única passagem direta.

  • O sistema oferece até 3,18x mais velocidade de decodificação em uma H100 e até 2,87x em um MacBook Pro M4 Max sem alterar as saídas do modelo.
  • Sob decodificação gulosa (greedy), a sequência emitida é idêntica à do modelo alvo executado sozinho, garantindo que a precisão nos benchmarks permaneça inalterada.
  • O DSpark combina uma espinha dorsal paralela estilo DFlash com uma cabeça sequencial leve modelada como uma cadeia de Markov e um verificador com agendamento de confiança.
  • Cenários de chamada de função com múltiplas ferramentas apresentam uma redução média de latência de 57% para o LFM2.5-2.6B, embora os modelos MoE ganhem apenas 1,18x no silício da Apple devido a limitações atuais da implementação.
  • Os pesos estão disponíveis como Safetensors e GGUF, com suporte desde o primeiro dia em llama.cpp e SGLang.

A tecnologia permite que desenvolvedores reduzam significativamente a latência de inferência para assistentes de código locais, agentes em dispositivo e copilotos offline, mantendo a privacidade dos dados por meio de auto-hospedagem.