Liquid AI는 시각-언어 모델 LFM2.5-VL-3B를 위한 실험용 DSpark 초안 모델을 출시하여 출력 품질을 변경하지 않고 에지 장치 및 GPU에서 더 빠른 디코딩을 가능하게 했습니다.

드래프터는 배포된 모델의 매개변수 수에 약 8.9%를 추가하고 H100 GPU에서 최대 2.66배, Apple Silicon 에지 장치에서 3.13배의 디코딩 처리량 개선을 달성합니다.

엔드투엔드 처리량 이득은 GPU에서 2.27배, 에지 하드웨어에서 2.62배에 달하며, 시스템은 SGLang의 다양한 동시성 수준 전반에 걸쳐 처리량 우위를 유지합니다.

저자들은 추론 디코딩이 디코딩 단계만 가속화한다는 점에 주목했으며, 이는 시각 인코딩 및 프리필 비용이 변경되지 않음을 의미하므로 자원 제약이 있는 에지 장치에서의 전체 지연 시간 개선이 제한된다고 밝혔습니다.