Microsoft Researchは、マルチモーダル大規模言語モデルが接続性、包含、順序、分離、結び目に関する位相直感を持っているかどうかを評価するために設計された新しいベンチマークであるMindTopoを導入しました。
- このベンチマークはタスクを5つのカテゴリに整理しています:連続性、分離、順序、包含、結び目。
- 2つの認知レベルでパフォーマンスを測定します:静的なシーンでの推論と、インタラクティブな一連のアクションを通じた計画。
- すべてのシーンは正確な正解と調整可能な難易度を提供するために制御されたシミュレータから生成されます。
- 現在のモデルは、インタラクティブな計画タスクよりも静的な認識タスクで著しく高いパフォーマンスを示します。
- 計画における失敗は、シーンが変化するにつれて構造的関係を見失ったり、物理的制約に違反するアクションを提案したりすることに起因することが多いです。
これらの知見は、静的な画像で位相を理解することと、行動しながらその理解を維持することの間に大きなギャップがあることを浮き彫りにしており、ロボティクスやインタラクティブな環境向けのAIシステムの発展における機会を示唆しています。