Para penulis merilis LFM2.5-2.6B, sebuah model agentic 2.6B parameter yang dirancang untuk berjalan sepenuhnya di perangkat untuk perencanaan, pemanggilan alat, dan tugas multi-langkah. Ukurannya cukup kecil untuk beroperasi pada ponsel dan cukup cepat untuk tetap responsif pada CPU, menawarkan inferensi gratis, latensi rendah, dan privasi tanpa ketergantungan pada API cloud.
- Model ini pra-dilatih pada ~34T token dan memiliki kosakata 128K yang diperluas untuk skrip non-Latin.
- Pasca-pelatihan menggunakan pipa empat tahap: Fine-Tuning Supervised, Spesialisasi Guru, Distilasi On-Policy Multi-Domain, dan Pembelajaran Penguatan Agentic.
- Model ini memimpin dalam benchmark pengikut instruksi dan mengungguli model Gemma pada tugas agentic, sementara tertinggal di belakang Qwen3.5-9B hanya pada metrik matematika dan pemrograman tertentu.
- Inferensi didukung melalui llama.cpp, MLX, vLLM, SGLang, dan ONNX, mencapai hingga 15K token keluaran per detik pada NVIDIA H100.
Hal ini memungkinkan pengembang membangun agen yang diparalelkan secara masif yang berjalan sepanjang waktu di perangkat lokal tanpa biaya marginal.