Les auteurs publient LFM2.5-2.6B, un modèle agentique de 2,6 milliards de paramètres conçu pour fonctionner entièrement sur l'appareil pour la planification, l'appel d'outils et les tâches multi-étapes. Il est suffisamment petit pour fonctionner sur des téléphones et suffisamment rapide pour rester réactif sur les CPU, offrant une inférence gratuite, une faible latence et la confidentialité sans dépendre d'API cloud.
- Le modèle a été pré-entraîné sur ~34T de tokens et dispose d'un vocabulaire de 128K étendu pour les scripts non latins.
- L'entraînement postérieur utilise un pipeline en quatre étapes : Affinage Supervisé, Spécialisation du Professeur, Distillation Multi-Domaine On-Policy et Apprentissage par Renforcement Agentique.
- Il domine les benchmarks de suivi d'instructions et surpasse les modèles Gemma sur les tâches agentiques, tout en étant légèrement inférieur à Qwen3.5-9B uniquement sur des métriques spécifiques de mathématiques et de codage.
- L'inférence est prise en charge via llama.cpp, MLX, vLLM, SGLang et ONNX, atteignant jusqu'à 15K tokens de sortie par seconde sur un NVIDIA H100.
Cela permet aux développeurs de construire des agents massivement parallélisés qui fonctionnent 24h/24 sur du matériel local sans coût marginal.