著者らは、計画、ツール呼び出し、マルチステップタスクのために完全にオンデバイスで実行できるように設計された26億パラメータのエージェント型モデルLFM2.5-2.6Bをリリースしました。このモデルはスマートフォン上で動作するに十分な小ささであり、CPU上でも応答性を維持できるほど高速で、クラウドAPIへの依存なしに無料の推論、低レイテンシ、プライバシーを実現します。

  • モデルは約34Tトークンで事前学習され、非ラテン文字向けに拡張された128Kの語彙を持っています。
  • 後期学習には4つの段階のパイプラインが使用されます:教師付き微調整、教師の専門化、マルチドメインオンポリシー蒸留、およびエージェント型強化学習。
  • インストラクションフォローイングベンチマークで首位を走り、エージェント型タスクにおいてGemmaモデルを上回りますが、特定の数学やコーディングの指標ではQwen3.5-9Bに僅かに劣ります。

llama.cpp、MLX、vLLM、SGLang、ONNXによる推論がサポートされており、NVIDIA H100上では毎秒最大15K出力トークンを達成します。

これにより、開発者はローカルハードウェア上で無償で24時間稼働する大規模並列エージェントを構築できるようになります。