A Liquid AI lançou o LFM2.5-VL-3B-DSpark, um modelo de rascunho experimental para decodificação especulativa do seu modelo de visão e linguagem LFM2.5-VL-3B. O draftspeculator adiciona aproximadamente 280M parâmetros e acelera a geração de tokens sem alterar a distribuição de saída do modelo.

  • O draftspeculator com 279,5M parâmetros usa uma arquitetura simplificada apenas de atenção com 4 camadas, aumentando a contagem total de parâmetros implantados em 8,9%.
  • As velocidades de decodificação chegam a até 3,13x no hardware Apple M5 Max e 2,66x nas GPUs NVIDIA H100, embora os ganhos de ponta a ponta sejam menores devido aos tempos fixos de codificação de imagem.
  • Os pesos estão disponíveis nos formatos Safetensors e GGUF com suporte desde o primeiro dia para SGLang, MLX-VLM e llama.cpp sob a LFM Open License v1.0.
  • A saída permanece idêntica ao modelo base na decodificação gulosa (greedy), enquanto temperaturas mais altas reduzem as taxas de aceitação e a taxa de transferência.

O lançamento permite que os usuários acelerem significativamente a inferência em hardware compatível, com a Liquid AI observando que as fases de prefill e codificação de visão permanecem não aceleradas.