Os autores lançam o LFM2.5-2.6B, um modelo agêntico de 2,6 bilhões de parâmetros projetado para rodar inteiramente no dispositivo para planejamento, chamada de ferramentas e tarefas em múltiplos passos. Ele é pequeno o suficiente para operar em telefones e rápido o bastante para manter a responsividade em CPUs, oferecendo inferência gratuita, baixa latência e privacidade sem dependências de APIs na nuvem.

  • O modelo foi pré-treinado com ~34T tokens e possui um vocabulário de 128K estendido para scripts não latinos.
  • O pós-treinamento utiliza um pipeline de quatro etapas: Ajuste Fino Supervisionado, Especialização do Professor, Distilação On-Policy Multidomínio e Aprendizado por Reforço Agêntico.
  • Ele lidera benchmarks de seguimento de instruções e supera os modelos Gemma em tarefas agênticas, enquanto fica atrás do Qwen3.5-9B apenas em métricas específicas de matemática e codificação.
  • A inferência é suportada via llama.cpp, MLX, vLLM, SGLang e ONNX, alcançando até 15K tokens de saída por segundo em uma NVIDIA H100.

Isso permite que desenvolvedores construam agentes massivamente paralelizados que operam ininterruptamente em hardware local sem custo marginal.