Liquid AI telah merilis LFM2.5-VL-3B, model visi-bahasa berparameter 3.1B yang dirancang untuk penyebaran efisien di perangkat. Model ini membaca layar digital di lingkungan seluler, web, dan desktop, menjangkar objek ke koordinat, menguraikan dokumen, dan mengeksekusi pemanggilan alat dari input teks atau gambar.

  • Performa: Rata-rata 69.4 di 28 benchmark visi, setara dengan InternVL-3.5-4B dan tertinggal 0.7 poin dari Qwen3.5-4B.
  • Kemampuan Baru: Memperkenalkan pemanggilan fungsi (ToolSandbox 59.5, BFCL v4 32.5) dan penjangkaran yang lebih baik (RefCOCO-avg 87.9).
  • Efisiensi: Muat dalam ~3 GB memori, melakukan decoding 228 tok/s pada Apple M5 Max.
  • Lisensi: Penggunaan komersial gratis untuk perusahaan dengan pendapatan tahunan di bawah $10M; perusahaan besar harus menegosiasikan lisensi.

Model ini tidak bernalar untuk menjaga latensi tetap rendah dan tersedia dalam format native, GGUF, ONNX, dan MLX dengan dukungan untuk llama.cpp, MLX, vLLM, SGLang, dan runtime ONNX.