Liquid AI는 자사의 LFM2.5-VL-3B 비전-언어 모델을 위한 실험적 추측적 디코딩 드래프트 모델인 LFM2.5-VL-3B-DSpark를 출시했습니다. 이 드래프터는 약 280M개의 파라미터를 추가하여 모델의 출력 분포를 변경하지 않고 토큰 생성을 가속화합니다.

  • 279.5M 파라미터를 가진 드래프터는 4층으로 구성된 단순화된 어텐션 전용 아키텍처를 사용하며, 총 배포된 파라미터 수를 8.9% 증가시킵니다.
  • Apple M5 Max 실리콘에서는 최대 3.13배, NVIDIA H100 GPU에서는 2.66배의 디코딩 속도를 달성하지만, 고정된 이미지 인코딩 시간으로 인해 전체적인 이점은 낮습니다.
  • 가중치는 Safetensors 및 GGUF 형식으로 제공되며, LFM Open License v1.0 하에 SGLang, MLX-VLM, llama.cpp에 대한 첫날 지원을 제공합니다.
  • 그리디 디코딩 시 출력은 기본 모델과 동일하게 유지되지만, 높은 온도 설정은 수용률과 처리량을 감소시킵니다.

이 출시로 사용자는 호환되는 하드웨어에서 추론 속도를 크게 향상시킬 수 있으며, Liquid AI는 프리필 및 비전 인코딩 단계는 가속화되지 않았다고 밝혔습니다.