Liquid AIは、効率的なオンデバイス展開のために設計された31億パラメータのビジョン言語モデルであるLFM2.5-VL-3Bをリリースした。このモデルは、モバイル、Web、デスクトップ環境におけるデジタル画面を読み取り、オブジェクトを座標に接地し、ドキュメントを解析し、テキストまたは画像入力からツール呼び出しを実行する。
- パフォーマンス: 28のビジョンベンチマークで平均69.4を獲得し、InternVL-3.5-4Bと同等で、Qwen3.5-4Bには0.7ポイント及ばない。
- 新機能: ファンクション呼び出し(ToolSandbox 59.5、BFCL v4 32.5)と改善されたグラウンディング(RefCOCO-avg 87.9)を導入。
- 効率性: メモリ約3GBに収まり、Apple M5 Maxで228 tok/sのデコーディングを実現。
- ライセンス: 年間収益1000万ドル未満の企業は商用利用が無料;大規模企業はライセンスを交渉する必要がある。
このモデルは低レイテンシを維持するために推論機能を持たず、llama.cpp、MLX、vLLM、SGLang、ONNXランタイムのサポート付きで、ネイティブ、GGUF、ONNX、MLX形式で提供される。