Liquid AI telah membuka sumber model draf DSpark untuk seri LFM2.5-nya, memungkinkan dekoding spekulatif yang memberikan peningkatan throughput hingga 3,18x pada GPU dan 2,87x pada perangkat.

  • Arsitektur DSpark menggabungkan tulang punggung paralel, kepala sekuensial ringan, dan pemverifikasi terjadwal kepercayaan untuk mengurangi latensi pada fase decode yang dibatasi memori.
  • Dukungan hari pertama disediakan untuk llama.cpp dan SGLang, memungkinkan pengguna menjalankan model dengan perubahan konfigurasi minimal.
  • Pada MacBook Pro M4 Max, LFM2.5-2.6B mencapai kecepatan melebihi 140 tok/s, sementara latensi pemanggilan fungsi berkurang rata-rata sebesar 57%.
  • Cekpoint model draf tersedia dalam format Safetensors dan GGUF untuk berbagai ukuran LFM2.5 termasuk 1.2B, 2.6B, dan 8B.

Integrasi ini memungkinkan pengguna menerapkan inferensi agentic yang efisien secara lokal atau pada akselerator tanpa mengorbankan akurasi dekoding greedy.