A Liquid AI lançou o modelo em rascunho LFM2.5-VL-DSpark, um drafter de decodificação especulativa projetado para acelerar a inferência do modelo de visão e linguagem LFM2.5-VL-3B. O drafter captura estados ocultos de camadas fixas do modelo alvo para gerar tokens candidatos, adicionando apenas 280M parâmetros (sobrecarga de 8,9%) enquanto mantém a dimensionalidade idêntica entre as modalidades.

  • Acelerações na velocidade de decodificação chegam a até 3,13x em dispositivos Apple M5 Max e 2,66x em GPUs NVIDIA H100.
  • Melhorias na latência de ponta a ponta variam de 1,56x a 2,62x no dispositivo e de 1,64x a 2,27x na GPU.
  • O modelo oferece suporte de integração desde o primeiro dia para llama.cpp, MLX-VLM e SGLang.
  • A decodificação especulativa acelera apenas a fase de decodificação; o prefill e a codificação da visão permanecem como gargalos limitados pela computação em dispositivos de borda.

O lançamento permite uma implantação mais rápida de modelos de visão e linguagem de peso aberto em diversos ambientes de hardware, sem restringir o ajuste fino ou a distribuição.