Liquid AI가 LFM2.5 시리즈를 위한 DSpark 초안 모델을 오픈소스로 공개하여, GPU에서 최대 3.18배, 기기에서는 2.87배의 처리량 개선을 제공하는 스펜크티브 디코딩을 가능하게 했습니다.

  • DSpark 아키텍처는 병렬 백본, 경량 시퀀셜 헤드, 그리고 신뢰도 스케줄링 검증자를 결합하여 메모리 바운드 디코드 단계의 지연 시간을 줄입니다.
  • llama.cpp와 SGLang에 대한 당일 지원을 제공하여, 사용자들이 최소한의 구성 변경으로 모델을 실행할 수 있게 합니다.
  • M4 Max MacBook Pro에서 LFM2.5-2.6B는 140 tok/s를 초과하는 속도를 달성하며, 함수 호출 지연 시간은 평균 57% 감소합니다.
  • 1.2B, 2.6B, 8B 등 다양한 LFM2.5 크기에 대한 초안 모델 체크포인트가 Safetensors와 GGUF 형식으로 제공됩니다.

이 통합을 통해 사용자는 그리디 디코딩의 정확성을 희생하지 않고도 로컬 또는 가속기에서 효율적인 에이전트 추론을 배포할 수 있습니다.