Команда LFM2.5 выпустила обновлённые чекпоинты GGUF 4-битной разрядности для моделей LFM2.5-230M, LFM2.5-350M, LFM2.5-1.2B-Instruct и LFM2.5-2.6B, обученные с помощью квантующей дистилляции (QAD). Этот метод позволяет дистиллировать высокоточную модель-учителя в квантованную модель-студента для восстановления точности, потерянной при стандартной квантовании.

  • QAD восстанавливает примерно 97% разрыва в производительности между BF16 и стандартным постобучающим квантованием Q4_0 для всех четырёх размеров моделей.
  • Конкретные показатели восстановления составляют 70,6% для LFM2.5-230M, 73,4% для LFM2.5-350M, 65,5% для LFM2.5-1.2B и 48,4% для LFM2.5-2.6B.
  • Бенчмарки, охватывающие рассуждения, следование инструкциям, использование инструментов и агентные возможности, были проведены на GPQA Diamond, MMLU-Pro, IFEval, IFBench, Multi-IF, BFCLv4, GSM8K и AIME25.
  • Чекпоинты сохраняют высокую пропускную способность нативных GGUF Q4_0, при этом соответствуя или превосходя качество форматов Q5_K_M и Q4_K_M на протестированных аппаратных бэкендах.

Эти обновления позволяют устройствам edge сохранять низкий объём потребляемой памяти и высокую скорость вывода без значительного снижения точности по сравнению с моделями полной разрядности.