يُعد LFM2.5-VL-3B نموذجًا جديدًا للغة والرؤية يقدم أداءً تنافسيًا أمام النماذج الأكبر مع الحفاظ على زمن استجابة منخفض لتطبيقات الوقت الحقيقي والأجهزة الطرفية. وهو يعتمد على الإصدار السابق LFM2-VL-3B مع تحسينات كبيرة في فهم الشاشة، والتأريض، واستدعاء الوظائف، وقدرات الإدخال متعدد الصور.
- متوسط فهم الشاشة/واجهة المستخدم يبلغ 80.7 على ScreenSpot-v2، متفوقًا على Gemma-4-E4B (51.2) و Qwen 3.5 4B (78.5).
- ارتفع score استدعاء الوظائف من ضعفين فأكثر من 26.4 إلى 59.5 على ToolSandbox، وصعد إلى 32.5 على BFCL v4.
- دقة التأريض@1 على RefCOCO ارتفعت من 57.1 إلى 87.9 عبر بيانات اصطناعية موسعة.
- تحسّن الاستدلال متعدد الصور برفع درجات BLINK من 50.2 إلى 61.5 و MUIRBench من 34.9 إلى 58.3.
- يفكّك النموذج 228 رمزًا/ثانية على Apple M5 Max و 20 رمزًا/ثانية على Galaxy S26 Ultra، مستخدمًا حوالي 3 جيجابايت من الذاكرة.
تضمن البنية غير الاستدلالية استجابات سريعة للرمز الأول، مما يجعلها مناسبة للاستدلال الخاص على الجهاز الخادم وخدمة وحدات معالجة الرسومات عالية الإنتاجية.