L'équipe LFM2.5 a publié des checkpoints GGUF 4 bits mis à jour pour les modèles LFM2.5-230M, LFM2.5-350M, LFM2.5-1.2B-Instruct et LFM2.5-2.6B, entraînés à l'aide de la Distillation Aware de Quantification (QAD). Cette technique distille un modèle enseignant haute précision dans un élève quantifié afin de récupérer la précision perdue lors de la quantification post-entraînement standard.

  • QAD récupère environ 97 % de l'écart de performance entre BF16 et la quantification post-entraînement Q4_0 standard sur les quatre tailles de modèles.
  • Les taux de récupération spécifiques sont de 70,6 % pour LFM2.5-230M, 73,4 % pour LFM2.5-350M, 65,5 % pour LFM2.5-1.2B et 48,4 % pour LFM2.5-2.6B.
  • Des benchmarks couvrant le raisonnement, le respect des instructions, l'utilisation d'outils et les capacités agentic ont été réalisés sur GPQA Diamond, MMLU-Pro, IFEval, IFBench, Multi-IF, BFCLv4, GSM8K et AIME25.
  • Les checkpoints maintiennent le haut débit des GGUF Q4_0 natifs tout en égalant ou dépassant la qualité des formats Q5_K_M et Q4_K_M sur les backends matériels testés.

Ces mises à jour permettent aux appareils edge de conserver une empreinte mémoire faible et des vitesses d'inférence élevées sans dégradation significative de la précision par rapport aux modèles pleine précision.