LFM2.5-VL-3Bは、リアルタイムおよびオンデバイスアプリケーションの低レイテンシを維持しつつ、より大規模なモデルに対抗する競争力のあるパフォーマンスを提供する新しいビジョン・ランゲージモデルです。これは以前のLFM2-VL-3Bリリースを基盤としており、画面理解、グラウンディング、関数呼び出し、マルチイメージ入力機能において大幅な強化が図られています。
- 画面/UIの理解はScreenSpot-v2で平均80.7となり、Gemma-4-E4B (51.2) や Qwen 3.5 4B (78.5) を上回ります。
- ToolSandboxでの関数呼び出しスコアは26.4から59.5へと倍以上に向上し、BFCL v4では32.5に達します。
- スケーリングされた合成データにより、RefCOCOにおけるグラウンディングのprecision@1は57.1から87.9へ上昇しました。
- マルチイメージ推論において、BLINKスコアは50.2から61.5へ、MUIRBenchは34.9から58.3へと改善されました。
- Apple M5 Maxでは228 tok/s、Galaxy S26 Ultraでは20 tok/sのデコード速度を実現し、メモリ使用量は約3 GBです。
推論不要なアーキテクチャにより最初のトークンの応答が高速化され、プライベートなオンデバイス推論や高スループットのGPUサービングに適しています。