LFM2.5 팀은 양자화 인식 증류(Quantization-Aware Distillation, QAD)를 사용하여 훈련된 LFM2.5-230M, LFM2.5-350M, LFM2.5-1.2B-Instruct 및 LFM2.5-2.6B 모델용 업데이트된 4비트 GGUF 체크포인트를 출시했습니다. 이 기법은 고정밀 교사 모델을 양자화된 학생 모델로 증류하여 표준 양자화 과정에서 손실된 정확도를 복원합니다.

  • QAD는 모든 네 가지 모델 크기에서 BF16와 표준 Q4_0 사후 훈련 양자화 간의 성능 격차를 약 97% 복원합니다.
  • 구체적인 복원율은 LFM2.5-230M의 경우 70.6%, LFM2.5-350M의 경우 73.4%, LFM2.5-1.2B의 경우 65.5%, LFM2.5-2.6B의 경우 48.4%입니다.
  • 추론, 지시 따르기, 도구 사용 및 에이전트 능력을 포괄하는 벤치마크는 GPQA Diamond, MMLU-Pro, IFEval, IFBench, Multi-IF, BFCLv4, GSM8K 및 AIME25에서 수행되었습니다.
  • 체크포인트는 테스트된 하드웨어 백엔드에서 Q5_K_M 및 Q4_K_M 형식의 품질을 일치하거나 초과하면서 네이티브 Q4_0 GGUF의 높은 처리량을 유지합니다.

이 업데이트를 통해 엣지 디바이스는 전체 정밀도 모델과 비교했을 때 상당한 정확도 저하 없이 낮은 메모리 사용량과 높은 추론 속도를 유지할 수 있습니다.