Авторы выпускают LFM2.5-2.6B, агентную модель с 2,6 млрд параметров, предназначенную для полного выполнения задач планирования, вызова инструментов и многошаговых операций непосредственно на устройстве. Она достаточно компактна для работы на смартфонах и быстра для поддержания отзывчивости на процессорах, обеспечивая бесплатный вывод, низкую задержку и конфиденциальность без зависимости от облачных API.
- Модель предварительно обучена на ~34 трлн токенов и имеет словарь размером 128K, расширенный для нелатинских скриптов.
- Постобучение использует четырехэтапный конвейер: контролируемое тонкое донастройка (SFT), специализация учителя, дистилляция многодоменной политики на месте и агентное обучение с подкреплением.
- Модель лидирует в бенчмарках следования инструкциям и превосходит модели Gemma в агентных задачах, уступая Qwen3.5-9B лишь в некоторых метриках по математике и программированию.
- Вывод поддерживается через llama.cpp, MLX, vLLM, SGLang и ONNX, достигая скорости до 15K выходных токенов в секунду на NVIDIA H100.
Это позволяет разработчикам создавать массово параллелизованные агенты, работающие круглосуточно на локальном оборудовании без дополнительных затрат.