저자들은 계획, 도구 호출, 다단계 작업을 위해 온디바이스에서 완전히 실행되도록 설계된 26억 파라미터의 에이전트 모델인 LFM2.5-2.6B를 출시했습니다. 이 모델은 스마트폰에서 작동할 만큼 작고 CPU에서도 반응 속도를 유지할 만큼 빨라 클라우드 API 의존성 없이 무료 추론, 낮은 지연 시간, 프라이버시를 제공합니다.
- 이 모델은 약 34조 토큰으로 사전 학습되었으며 비라틴 문자를 위해 확장된 128K 어휘를 특징으로 합니다.
- 사후 학습은 지도 미세 조정, 교사 특화, 다도메인 온폴리시 증류, 에이전트 강화 학습이라는 네 단계 파이프라인을 활용합니다.
- 지시 따르기 벤치마크에서 선두를 차지하며 에이전트 작업에서 Gemma 모델보다 우수하지만 특정 수학 및 코딩 지표에서는 Qwen3.5-9B에 뒤집니다.
llama.cpp, MLX, vLLM, SGLang, ONNX를 통해 추론이 지원되며 NVIDIA H100에서 초당 최대 15K 출력 토큰을 달성합니다.
이를 통해 개발자는 마진 비용 없이 로컬 하드웨어에서 연중무휴로 실행되는 대규모 병렬화된 에이전트를 구축할 수 있습니다.