लिक्विड एआई ने LFM2.5-VL-3B जारी किया है, जो एक 3-बिलियन पैरामीटर वाला विज़न-लैंग्वेज मॉडल है जिसे एज डिवाइसों पर बेहतर और तेज प्रदर्शन प्रदान करने के लिए डिज़ाइन किया गया है। यह मॉडल एक SigLIP2 400M NaFlex विज़न एन्कोडर को अपने टेक्स्ट-केवल समकक्ष की बैकबोन के साथ जोड़ता है, जिसका प्रशिक्षण लगभग 34 ट्रिलियन टोकन पर किया गया है, जिसमें पिछली रिलीजों की तुलना में चार गुना अधिक विज़न डेटा शामिल है।
- मुख्य क्षमताओं में स्क्रीन और UI समझ में सुधार, ऑब्जेक्ट डिटेक्शन के लिए बेहतर ग्रौंडिंग, मल्टी-इमेज रीजनिंग, और टेक्स्ट-केवल तथा विज़न-टेक्स्ट दोनों संदर्भों में मजबूत फंक्शन कॉलिंग शामिल हैं।
- यह मॉडल लगभग 3 GB मेमोरी में फिट होता है, M5 Max पर 228 tok/s और Ryzen AI Max+ 395 पर 116 tok/s पर डिकोड करता है, जबकि Galaxy S26 Ultra पर 20 tok/s तक पहुँचता है।
- GPU इनफरेंस पर, यह उच्च कन्करेंसी पर प्रति सेकंड लगभग 11K टोकन प्राप्त करता है, जो बड़े 4B-क्लास मॉडल की थ्रूपुट का लगभग दोगुना है और छोटे 2B-क्लास मॉडल से आगे है।
इस रिलीज का उद्देश्य हाई-वॉल्यूम ऑन-डिवाइस वर्कलोड के लिए मजबूत, सामान्य-उद्देश्य विज़न-लैंग्वेज इंटेलिजेंस प्रदान करना है, जिसमें llama.cpp, MLX, vLLM, SGLang, और ONNX जैसे इनफरेंस फ्रेमवर्क्स के लिए डे-वन सपोर्ट शामिल है।