أطلقت Liquid AI نموذج LFM2.5-VL-3B، وهو نموذج لغوي-رؤية يحتوي على 3 مليارات معلمة، صُمم لتقديم أداء محسّن وأسرع على أجهزة الحافة. يجمع النموذج بين مشفر رؤية SigLIP2 400M NaFlex مع العمود الفقري لنسخته النصية فقط، وتم تدريبه على حوالي 34 تريليون رمز، بما في ذلك أربعة أضعاف بيانات الرؤية مقارنة بالإصدارات السابقة.
- تشمل القدرات الرئيسية فهمًا محسّنًا للشاشات وواجهات المستخدم، ودعم أفضل للكشف عن الأجسام، واستدلالًا متعدد الصور، ومكالمات وظائف أقوى في كل من السياقات النصية فقط والنصية-الرؤية.
- يستوعب النموذج حوالي 3 جيجابايت من الذاكرة، بمعدل فك تشفير يبلغ 228 رمز/ثانية على M5 Max و116 رمز/ثانية على Ryzen AI Max+ 395، بينما يصل إلى 20 رمز/ثانية على Galaxy S26 Ultra.
- في الاستدلال عبر وحدات معالجة الرسومات، يحقق حوالي 11 ألف رمز في الثانية عند التزامن العالي، وهو ما يعادل تقريبًا ضعف الإنتاجية للنماذج الأكبر من فئة 4B ومتقدمًا على النماذج الأصغر من فئة 2B.
تهدف الإصدار إلى توفير ذكاء لغوي-رؤية قوي وعام لأحمال العمل عالية الحجم على الجهاز، مع دعم فوري لإطارات الاستدلال مثل llama.cpp وMLX وvLLM وSGLang وONNX.