作者发布了 LFM2.5-2.6B,这是一款拥有 2.6B 参数的智能体模型,专为在设备端完全运行而设计,适用于规划、工具调用和多步任务。它足够小巧,可在手机上运行;也足够快速,能在 CPU 上保持响应能力,提供无需依赖云端 API 的免费推理、低延迟和隐私保护。

  • 该模型在约 34T tokens 上进行预训练,并采用了扩展至非拉丁脚本的 128K 词表。
  • 后训练采用四阶段流水线:监督微调(SFT)、教师专业化、多域在线策略蒸馏以及智能体强化学习。
  • 它在指令遵循基准测试中领先,并在智能体任务上优于 Gemma 模型,仅在特定的数学和代码指标上略逊于 Qwen3.5-9B。
  • 推理支持通过 llama.cpp、MLX、vLLM、SGLang 和 ONNX 实现,在 NVIDIA H100 上最高可达每秒 15K 输出 tokens。

这使得开发者能够构建大规模并行化的智能体,以零边际成本在本地硬件上全天候运行。