アリババのQwenチームは、以前のビジョン言語モデルのアップグレードであるQwen2-VLシリーズを発表しました。これは固定解像度処理をNaive Dynamic Resolutionメカニズムに置き換えます。これにより、モデルは入力解像度に基づいて視覚トークンを動的に調整し、詳細のキャプチャを改善し、人間の知覚プロセスと一致させます。

  • シリーズには2B、8B、72Bパラメータのオープンウェイトモデルが含まれます。
  • マルチモーダル回転位置埋め込み(M-RoPE)の統合により、テキスト、画像、動画間の位置情報が融合されます。
  • Qwen2-VL-72BはマルチモーダルベンチマークでGPT-4oおよびClaude 3.5 Sonnetに匹敵するパフォーマンスを達成しました。
  • アーキテクチャは長時間の動画理解と多言語画像テキスト理解をサポートします。

これらのモデルは、複雑な推論タスクに対して効率的な視覚表現を提供し、さまざまなスケールで競争力のあるパフォーマンスを維持することを目指しています。