inclusionAIは、ネイティブな画像および動画理解機能を備え、先行モデルの言語および推論能力を拡張するオープンソースのLing-3.0-flash-VLモデルをリリースしました。
124Bパラメータのモデルは、トークンごとに5.5Bパラメータのみをアクティブ化し、最大1Mトークンのコンテキストウィンドウをサポートします。そのアーキテクチャには、MLPプロジェクタでアライメントされたViT視覚エンコーダ、時間エンコーディング用のVideoRoPE、KDAとGated MLAレイヤーを交互に配置したハイブリッドバックボーンが含まれます。
この設計は、スパースMixture of Expertsによる推論効率を維持しつつ、現実世界の推論やエージェントワークフローに視覚情報を統合します。