Liquid AI는 LFM2.5-VL-3B 비전-언어 모델의 추론을 가속화하기 위해 설계된 추측적 디코딩용 드래프터인 LFM2.5-VL-DSpark 드래프트 모델을 출시했습니다. 이 드래프터는 대상 모델의 고정된 레이어에서 은닉 상태를 포착하여 후보 토큰을 생성하며, 모달리티 간 차원을 동일하게 유지하면서 280M 파라미터(8.9% 오버헤드)만 추가합니다.

  • Apple M5 Max 장치에서는 디코딩 속도 향상률이 최대 3.13배에 달하고, NVIDIA H100 GPU에서는 2.66배입니다.
  • 온디바이스에서는 1.56배에서 2.62배까지, GPU에서는 1.64배에서 2.27배까지 엔드투엔드 지연 시간 개선 효과가 있습니다.
  • 이 모델은 llama.cpp, MLX-VLM, SGLang에 대한 당일 통합 지원을 제공합니다.
  • 추측적 디코딩은 디코드 단계만 가속화하며, 프리필 및 비전 인코딩은 엣지 장치에서 연산 병목 현상으로 남아 있습니다.

이 출시로 파인튜닝이나 배포를 제한하지 않고도 다양한 하드웨어 환경 전반에 걸쳐 오픈 가중치 비전-언어 모델의 더 빠른 배포가 가능해졌습니다.