A Liquid AI lançou um modelo rascunho experimental DSpark para seu modelo de visão e linguagem LFM2.5-VL-3B, permitindo decodificação mais rápida em dispositivos edge e GPUs sem alterar a qualidade de saída.

O drafter adiciona aproximadamente 8,9% à contagem de parâmetros do modelo implantado e alcança melhorias na taxa de decodificação de até 2,66x em GPUs H100 e 3,13x em dispositivos edge com Apple Silicon.

Os ganhos de throughput de ponta a ponta atingem 2,27x em GPUs e 2,62x em hardware edge, com o sistema mantendo uma vantagem de throughput em diferentes níveis de concorrência no SGLang.

Os autores observam que a decodificação especulativa acelera apenas a fase de decodificação, o que significa que os custos de codificação visual e prefill permanecem inalterados, limitando as melhorias gerais de latência em dispositivos edge com recursos limitados.