Liquid AI는 출력 품질을 저하시키지 않으면서 추론 속도를 크게 향상시키기 위해 추측 디코딩을 활용하는 자체 LFM2.5 계열의 초안 모델 체크포인트—구체적으로 LFM2.5-1.2B-Instruct, LFM2.5-2.6B, LFM2.5-8B-A1B—를 출시했습니다.
- DSpark 방법은 병렬 백본, 경량 순차적 헤드, 신뢰도 스케줄링 검증자를 결합하여 최소한의 메모리 트레이드오프로 큰 처리량 향상을 통해 지연 시간을 줄입니다.
- 벤치마크 결과 NVIDIA H100 GPU에서 최대 3.18배의 처리량 향상과 M4 Max MacBook Pro와 같은 엣지 디바이스에서 최대 2.87배의 향상이 확인되었습니다.
- 함수 호출이 포함된 에이전트 워크로드의 경우, DSpark는 BFCL 데이터셋에서 평균 57%의 지연 시간 감소를 보입니다.
- 초안 모델은 llama.cpp와 SGLang의 상위 저장소에 오픈소스로 공개되었으며, 체크포인트는 Hugging Face에서 Safetensors 및 GGUF 형식으로 제공됩니다.
이번 릴리스는 효율적인 엣지 추론과 높은 처리량의 GPU 서빙을 위한 초기 지원을 제공함으로써 LFM2.5를 온디바이스 에이전트 애플리케이션에 적합하게 만드는 것을 목표로 합니다.