A Liquid AI lançou checkpoints de modelos rascunho para sua família LFM2.5 — especificamente LFM2.5-1.2B-Instruct, LFM2.5-2.6B e LFM2.5-8B-A1B — que utilizam decodificação especulativa para melhorar significativamente a velocidade de inferência sem comprometer a qualidade da saída.
- O método DSpark combina uma espinha dorsal paralela, uma cabeça sequencial leve e um verificador com agendamento de confiança para reduzir a latência, trocando memória mínima por grandes ganhos de vazão.
- Os benchmarks mostram até 3.18x de melhoria na vazão em GPUs NVIDIA H100 e até 2.87x em dispositivos de borda como o MacBook Pro M4 Max.
- Para cargas de trabalho agênticas envolvendo chamada de funções, o DSpark reduz a latência em uma média de 57% no conjunto de dados BFCL.
- Os modelos rascunho são disponibilizados como código aberto upstream no llama.cpp e SGLang, com checkpoints disponíveis no Hugging Face nos formatos Safetensors e GGUF.
Este lançamento visa tornar o LFM2.5 viável para aplicações agênticas em dispositivo, fornecendo suporte desde o primeiro dia para inferência eficiente em borda e serviço de GPU com alta vazão.