El equipo de LFM2.5 ha publicado actualizaciones de los checkpoints GGUF de 4 bits para los modelos LFM2.5-230M, LFM2.5-350M, LFM2.5-1.2B-Instruct y LFM2.5-2.6B, entrenados mediante Distilación Consciente de Cuantización (QAD). Esta técnica destila un modelo maestro de alta precisión en un estudiante cuantizado para recuperar la precisión perdida durante la cuantización estándar.
- QAD recupera aproximadamente el 97% de la brecha de rendimiento entre BF16 y la cuantización post-entrenamiento Q4_0 estándar en los cuatro tamaños de modelo.
- Las tasas de recuperación específicas son del 70.6% para LFM2.5-230M, 73.4% para LFM2.5-350M, 65.5% para LFM2.5-1.2B y 48.4% para LFM2.5-2.6B.
- Se realizaron benchmarks que cubren razonamiento, seguimiento de instrucciones, uso de herramientas y capacidades agénticas en GPQA Diamond, MMLU-Pro, IFEval, IFBench, Multi-IF, BFCLv4, GSM8K y AIME25.
- Los checkpoints mantienen el alto rendimiento de los GGUFs Q4_0 nativos mientras igualan o superan la calidad de los formatos Q5_K_M y Q4_K_M en los backends de hardware probados.
Estas actualizaciones permiten que los dispositivos periféricos conserven bajas huellas de memoria y altas velocidades de inferencia sin una degradación significativa de la precisión en comparación con los modelos de precisión completa.