Liquid AI telah merilis model draf eksperimental DSpark untuk model visi-bahasanya LFM2.5-VL-3B, memungkinkan decoding yang lebih cepat pada perangkat edge dan GPU tanpa mengubah kualitas output.
Drafter menambahkan sekitar 8,9% ke jumlah parameter model yang diimplementasikan dan mencapai peningkatan throughput decoding hingga 2,66x pada GPU H100 dan 3,13x pada perangkat edge Apple Silicon.
Peningkatan throughput end-to-end mencapai 2,27x pada GPU dan 2,62x pada hardware edge, dengan sistem mempertahankan keunggulan throughput di berbagai tingkat konkurensi di SGLang.
Para penulis mencatat bahwa decoding spekulatif hanya mempercepat fase decoding, yang berarti biaya encoding visual dan prefill tetap tidak berubah, yang membatasi peningkatan latensi keseluruhan pada perangkat edge dengan sumber daya terbatas.