Liquid AI telah merilis LFM2.5-VL-3B-DSpark, model draf dekoding spekulatif eksperimental untuk model visi-bahasa LFM2.5-VL-3B-nya. Drafter ini menambahkan sekitar 280M parameter dan mempercepat generasi token tanpa mengubah distribusi keluaran model.
- Drafter dengan 279,5M parameter menggunakan arsitektur hanya-atensi yang disederhanakan dengan 4 lapisan, meningkatkan jumlah total parameter yang diimplementasikan sebesar 8,9%.
- Kecepatan dekoding mencapai hingga 3,13x pada silikon Apple M5 Max dan 2,66x pada GPU NVIDIA H100, meskipun peningkatan end-to-end lebih rendah karena waktu pengodean gambar yang tetap.
- Bobot tersedia dalam format Safetensors dan GGUF dengan dukungan hari pertama untuk SGLang, MLX-VLM, dan llama.cpp di bawah Lisensi Terbuka LFM v1.0.
- Keluaran tetap identik dengan model dasar saat dekoding serakah, sementara suhu yang lebih tinggi mengurangi tingkat penerimaan dan throughput.
Rilis ini memungkinkan pengguna mempercepat inferensi secara signifikan pada perangkat keras yang kompatibel, dengan Liquid AI mencatat bahwa fase prefill dan pengodean visi tetap tidak dipercepat.