A equipe do LFM2.5 lançou checkpoints GGUF atualizados de 4 bits para os modelos LFM2.5-230M, LFM2.5-350M, LFM2.5-1.2B-Instruct e LFM2.5-2.6B, treinados usando Distorção Sensível à Quantização (QAD). Esta técnica distila um modelo professor de alta precisão em um aluno quantizado para recuperar a precisão perdida durante a quantização padrão pós-treinamento.
- A QAD recupera aproximadamente 97% da lacuna de desempenho entre BF16 e a quantização pós-treinamento padrão Q4_0 em todos os quatro tamanhos de modelo.
- As taxas de recuperação específicas são 70,6% para LFM2.5-230M, 73,4% para LFM2.5-350M, 65,5% para LFM2.5-1.2B e 48,4% para LFM2.5-2.6B.
- Os benchmarks que cobrem raciocínio, seguimento de instruções, uso de ferramentas e capacidades agênticas foram realizados no GPQA Diamond, MMLU-Pro, IFEval, IFBench, Multi-IF, BFCLv4, GSM8K e AIME25.
- Os checkpoints mantêm a alta taxa de transferência dos GGUFs Q4_0 nativos enquanto igualam ou excedem a qualidade dos formatos Q5_K_M e Q4_K_M nos backends de hardware testados.
Essas atualizações permitem que dispositivos de borda mantenham baixos requisitos de memória e altas velocidades de inferência sem degradação significativa da precisão em comparação com modelos de precisão completa.