Liquid AI は、エッジデバイス上で改善された高速パフォーマンスを提供するために設計された 30億パラメータのビジョン・ランゲージモデルである LFM2.5-VL-3B をリリースしました。このモデルは、SigLIP2 400M NaFlex ビジョンエンコーダと、以前のリリースよりも4倍多いビジョンデータを含む約34兆トークンでトレーニングされたテキスト専用版のバックボーンを組み合わせています。
- 主要な機能には、画面およびUI理解の強化、物体検出のためのグラウンディングの改善、複数画像の推論、テキストのみおよびビジョン・テキストの両方のコンテキストにおける関数呼び出しの強化が含まれます。
- このモデルは約3 GBのメモリに収まり、M5 Max で228 tok/s、Ryzen AI Max+ 395 で116 tok/s のデコーディング速度を実現し、Galaxy S26 Ultra では20 tok/s に達します。
- GPU推論では、高同時実行時に秒間約11Kトークンを達成し、これはより大きな4Bクラスモデルのスループットの約2倍であり、より小さな2Bクラスモデルを上回ります。
今回のリリースは、大量のオンデバイスワークロード向けに強力な汎用ビジョン・ランゲージインテリジェンスを提供することを目的としており、llama.cpp、MLX、vLLM、SGLang、ONNX などの推論フレームワークを初日からサポートしています。