LFM2.5チームは、量子化意識蒸留(QAD)を使用してトレーニングされたLFM2.5-230M、LFM2.5-350M、LFM2.5-1.2B-Instruct、およびLFM2.5-2.6Bモデルの更新された4ビットGGUFチェックポイントをリリースしました。この手法は、高精度の教師モデルを量子化された生徒モデルに蒸留し、標準的な量子化中に失われた精度を回復します。

  • QADは、すべてのモデルサイズにおいてBF16と標準的なQ4_0ポストトレーニング量子化の間の性能ギャップの約97%を回復します。
  • 具体的な回復率は、LFM2.5-230Mで70.6%、LFM2.5-350Mで73.4%、LFM2.5-1.2Bで65.5%、LFM2.5-2.6Bで48.4%です。
  • 推論、指示のフォロー、ツール使用、およびエージェント機能を含むベンチマークがGPQA Diamond、MMLU-Pro、IFEval、IFBench、Multi-IF、BFCLv4、GSM8K、AIME25で実施されました。
  • チェックポイントは、テストされたハードウェアバックエンド上でQ5_K_MおよびQ4_K_Mフォーマットの品質に匹敵するかそれを超えながら、ネイティブなQ4_0 GGUFの高いスループットを維持します。

これらの更新により、エッジデバイスは完全精度モデルと比較して大幅な精度の低下なしに、低いメモリフットプリントと高い推論速度を維持できます。