A Liquid AI liberou como código aberto os modelos de rascunho DSpark para sua série LFM2.5, permitindo decodificação especulativa que oferece melhoria de throughput de até 3,18x em GPUs e 2,87x em dispositivos.

  • A arquitetura DSpark combina uma espinha dorsal paralela, uma cabeça sequencial leve e um verificador com agendamento de confiança para reduzir a latência na fase de decodificação limitada por memória.
  • O suporte no dia do lançamento é fornecido para llama.cpp e SGLang, permitindo que os usuários executem os modelos com mínimas alterações de configuração.
  • Em um MacBook Pro M4 Max, o LFM2.5-2.6B alcança velocidades superiores a 140 tok/s, enquanto a latência de chamada de função é reduzida em 57% em média.
  • Os checkpoints dos modelos de rascunho estão disponíveis nos formatos Safetensors e GGUF para vários tamanhos da LFM2.5, incluindo 1,2B, 2,6B e 8B.

A integração permite que os usuários implantem inferência agencial eficiente localmente ou em aceleradores sem sacrificar a precisão da decodificação gulosa.