LFM2.5-VL-3B adalah model visi-bahasa baru yang memberikan kinerja kompetitif dibandingkan dengan model yang lebih besar sambil mempertahankan latensi rendah untuk aplikasi waktu nyata dan di perangkat. Model ini dibangun dari rilis LFM2-VL-3B sebelumnya dengan peningkatan signifikan dalam pemahaman layar, grounding, pemanggilan fungsi, dan kemampuan input multi-gambar.

  • Pemahaman layar/UI mencapai rata-rata 80.7 pada ScreenSpot-v2, mengungguli Gemma-4-E4B (51.2) dan Qwen 3.5 4B (78.5).
  • Skor pemanggilan fungsi menjadi lebih dari dua kali lipat, dari 26.4 menjadi 59.5 pada ToolSandbox dan naik menjadi 32.5 pada BFCL v4.
  • Presisi grounding@1 pada RefCOCO meningkat dari 57.1 menjadi 87.9 melalui data sintetis yang diskalakan.
  • Penalaran multi-gambar meningkatkan skor BLINK dari 50.2 menjadi 61.5 dan MUIRBench dari 34.9 menjadi 58.3.
  • Model ini mendekode 228 tok/s pada Apple M5 Max dan 20 tok/s pada Galaxy S26 Ultra, menggunakan sekitar 3 GB memori.

Arsitektur non-penalaran memastikan respons token pertama yang cepat, sehingga cocok untuk inferensi di perangkat secara pribadi dan penyajian GPU ber-throughput tinggi.