Los autores publican LFM2.5-2.6B, un modelo agénico de 2.6B de parámetros diseñado para ejecutarse completamente en el dispositivo para planificación, llamada de herramientas y tareas multi-paso. Es lo suficientemente pequeño para operar en teléfonos y lo suficientemente rápido para mantenerse receptivo en CPUs, ofreciendo inferencia gratuita, baja latencia y privacidad sin dependencias de API en la nube.

  • El modelo fue pre-entrenado con ~34T tokens y cuenta con un vocabulario de 128K extendido para scripts no latinos.
  • El post-entrenamiento utiliza una canalización de cuatro etapas: Ajuste Fino Supervisado, Especialización del Maestro, Destilación Multi-Dominio On-Policy y Aprendizaje por Refuerzo Agénico.
  • Lidera en benchmarks de seguimiento de instrucciones y supera a los modelos Gemma en tareas agénicas, mientras queda detrás de Qwen3.5-9B solo en métricas específicas de matemáticas y codificación.
  • La inferencia es compatible mediante llama.cpp, MLX, vLLM, SGLang y ONNX, alcanzando hasta 15K tokens de salida por segundo en una NVIDIA H100.

Esto permite a los desarrolladores construir agentes masivamente paralelizados que operan las 24 horas del día en hardware local sin costo marginal.