Tim LFM2.5 telah merilis pembaruan checkpoint GGUF 4-bit untuk model LFM2.5-230M, LFM2.5-350M, LFM2.5-1.2B-Instruct, dan LFM2.5-2.6B, yang dilatih menggunakan Distilasi Sadar Kuantisasi (QAD). Teknik ini mendistilasi model guru presisi tinggi ke dalam model murid terkuantisasi untuk memulihkan akurasi yang hilang selama kuantisasi standar.
- QAD memulihkan sekitar 97% kesenjangan kinerja antara BF16 dan kuantisasi pasca-pelatihan Q4_0 standar di seluruh empat ukuran model.
- Tingkat pemulihan spesifik adalah 70,6% untuk LFM2.5-230M, 73,4% untuk LFM2.5-350M, 65,5% untuk LFM2.5-1.2B, dan 48,4% untuk LFM2.5-2.6B.
- Benchmark yang mencakup penalaran, kepatuhan instruksi, penggunaan alat, dan kemampuan agentic dilakukan pada GPQA Diamond, MMLU-Pro, IFEval, IFBench, Multi-IF, BFCLv4, GSM8K, dan AIME25.
- Checkpoint mempertahankan throughput tinggi GGUF Q4_0 asli sambil mencocokkan atau melampaui kualitas format Q5_K_M dan Q4_K_M pada backend perangkat keras yang diuji.
Pembaruan ini memungkinkan perangkat tepi mempertahankan jejak memori rendah dan kecepatan inferensi tinggi tanpa degradasi akurasi signifikan dibandingkan model presisi penuh.