Microsoft Research представила MindTopo — новый бенчмарк, предназначенный для оценки того, обладают ли мультимодальные большие языковые модели топологической интуицией в отношении связности, включения, порядка, разделения и узлов.

  • Бенчмарк организует задачи по пяти категориям: непрерывность, разделение, порядок, включение и узлы.
  • Он измеряет производительность на двух когнитивных уровнях: рассуждение о статических сценах и планирование через интерактивные последовательности действий.
  • Все сцены генерируются с помощью контролируемых симуляторов для обеспечения точного ground truth и регулируемой сложности.
  • Текущие модели значительно лучше справляются с задачами статического распознавания, чем с задачами интерактивного планирования.
  • Ошибки в планировании часто возникают из-за потери связи со структурными отношениями по мере изменения сцен или предложения действий, нарушающих физические ограничения.

Результаты подчеркивают существенный разрыв между распознаванием топологии на статическом изображении и поддержанием понимания этой топологии во время действий, что указывает на возможность развития AI-систем для робототехники и интерактивных сред.