Microsoftは、画像および動画の理解のために設計された効率的な4Bパラメータのマルチモーダル基盤モデル「Mage-VL」をリリースした。このモデルは視覚処理を効率化するためにコーデックネイティブのアプローチを採用している。システムは動画ストリームをアンカー(I)フレームと予測(P)フレームに分離し、コーデックがビットを割り当てるパッチのみを保持することで、視覚トークンの消費量を75%以上削減する。
- Mage-VLは、ゼロから構築されたCodec-ViT視覚エンコーダとQwen3-4B因果デコーダ言語バックボンを組み合わせる。
- このアーキテクチャは、空間時間的文脈を維持しつつ、均等なフレームサンプリングと比較して最大3.5倍のリアル推論速度向上を実現する。
- システム1&システム2のデュアルプロセス設計により、プロアクティブなストリーミングが追加され、軽量な認知ゲートによって必要な場合にのみ完全なVLMを呼び出す。
- 動画ベンチマークにおいて、Mage-VLは報告されたすべての指標でQwen3-VL-4Bを上回り、QVHighlightなどで+22.5という顕著な改善を示した。
このモデルは、複雑なオフライン推論とリアルタイムストリーミング知覚のトレードオフを対象としており、低遅延のイベント駆動型解説のための単一モデルソリューションを提供する。