أطلقت أبحاث مايكروسوفت معيار MindTopo، وهو معيار جديد صُمّم لتقييم ما إذا كانت النماذج اللغوية الكبيرة متعددة الوسائط تمتلك حدساً طوبولوجياً فيما يتعلق بالاتصال، والإحاطة، والترتيب، والفصل، والعقد.
- ينظم المعيار المهام إلى خمس فئات: الاستمرارية، والفصل، والترتيب، والإحاطة، والعقد.
- يقيس الأداء على مستويين معرفيين: الاستدلال في المشاهد الثابتة والتخطيط من خلال تسلسلات تفاعلية من الإجراءات.
- تم توليد جميع المشاهد باستخدام محاكيات خاضعة للتحكم لتوفير الحقيقة الأرضية الدقيقة وصعوبة قابلة للتعديل.
- تتفوق النماذج الحالية بشكل ملحوظ في مهام التعرف الثابت مقارنة بمهام التخطيط التفاعلي.
- غالباً ما تنبع فشل التخطيط من فقدان تتبع العلاقات الهيكلية مع تغير المشاهد، أو اقتراح إجراءات تنتهق القيود الفيزيائية.
تسلط النتائج الضوء على فجوة كبيرة بين التعرف على الطوبولوجيا في صورة ثابتة والحفاظ على فهمها أثناء التنفيذ، مما يشير إلى فرصة لتطوير أنظمة الذكاء الاصطناعي للروبوتات والبيئات التفاعلية.