Liquid AI telah merilis checkpoint GGUF Q4_0 untuk keluarga model LFM2.5-nya, memanfaatkan metode pelatihan baru yang disebut Distilasi Sadar Kuantisasi (QAD). Pendekatan ini mendistilasi model guru presisi tinggi ke dalam model siswa terkuantisasi untuk memulihkan akurasi yang hilang selama kuantisasi pasca-pelatihan standar.

  • Checkpoint QAD mempertahankan antara 96,5% dan 97,4% dari kinerja baseline BF16 di empat ukuran model: LFM2.5-230M, LFM2.5-350M, LFM2.5-1.2B-Instruct, dan LFM2.5-2.6B.
  • Pada perangkat tepi termasuk MacBook Pro, NucBox EVO-X2, Samsung Galaxy S26 Ultra, dan Raspberry Pi 5, checkpoint tersebut setara dengan tingkat kuantisasi berkualitas lebih tinggi (Q5_K_M atau Q4_K_M) sambil menawarkan throughput decode yang lebih tinggi sebesar 3-33%.
  • Model-model ini tersedia di Hugging Face dan kompatibel dengan llama.cpp serta runtime lain yang mendukung artefak GGUF Q4_0.

Rilis ini memungkinkan pengguna untuk menerapkan model LFM2.5 pada perangkat tepi yang terbatas sumber dayanya dengan kinerja yang sebanding dengan format kuantisasi yang lebih besar tanpa mengorbankan kecepatan.