Microsoft Research представила MindTopo — новый бенчмарк, предназначенный для оценки того, обладают ли мультимодальные большие языковые модели топологической интуицией в отношении связности, включения, порядка, разделения и узлов.
- Бенчмарк организует задачи по пяти категориям: непрерывность, разделение, порядок, включение и узлы.
- Он измеряет производительность на двух когнитивных уровнях: рассуждение о статических сценах и планирование через интерактивные последовательности действий.
- Все сцены генерируются с помощью контролируемых симуляторов для обеспечения точного ground truth и регулируемой сложности.
- Текущие модели значительно лучше справляются с задачами статического распознавания, чем с задачами интерактивного планирования.
- Ошибки в планировании часто возникают из-за потери связи со структурными отношениями по мере изменения сцен или предложения действий, нарушающих физические ограничения.
Результаты подчеркивают существенный разрыв между распознаванием топологии на статическом изображении и поддержанием понимания этой топологии во время действий, что указывает на возможность развития AI-систем для робототехники и интерактивных сред.