Liquid AI a publié des checkpoints GGUF Q4_0 pour sa famille de modèles LFM2.5, en utilisant une nouvelle méthode d'entraînement appelée Distillation Aware de Quantification (QAD). Cette approche distille des modèles enseignants de haute précision dans des modèles étudiants quantifiés afin de récupérer la précision perdue lors de la quantification post-entraînement standard.

  • Les checkpoints QAD conservent entre 96,5 % et 97,4 % des performances de référence BF16 sur quatre tailles de modèles : LFM2.5-230M, LFM2.5-350M, LFM2.5-1.2B-Instruct et LFM2.5-2.6B.
  • Sur du matériel edge incluant MacBook Pro, NucBox EVO-X2, Samsung Galaxy S26 Ultra et Raspberry Pi 5, les checkpoints correspondent aux niveaux de quantification de meilleure qualité (Q5_K_M ou Q4_K_M) tout en offrant un débit de décodage supérieur de 3 à 33 %.
  • Les modèles sont disponibles sur Hugging Face et compatibles avec llama.cpp et d'autres runtimes prenant en charge les artefacts GGUF Q4_0.

Cette publication permet aux utilisateurs de déployer les modèles LFM2.5 sur des appareils edge aux ressources limitées, avec des performances comparables aux formats de quantification plus volumineux sans sacrifier la vitesse.