NVIDIA的研究人员推出了Spatial-IQ,这是一种旨在解构多模态大语言模型(MLLMs)空间智能的诊断框架。与将模型视为黑盒的现有基准不同,该方法将堆叠3D结构中的物体计数分解为九个与人类发展阶段相一致的感知和认知子任务。

  • 该框架利用NVIDIA Isaac Sim过程化生成了一个包含约80,000个堆叠3D结构的数据集,并为每个子任务提供真实标签。
  • 在自由回答文本、多项选择图像和图像编辑格式上的评估显示,表现最佳的模型往往能在目标任务上取得成功,却在较低级别的子任务上失败,这表明存在捷径行为。
  • 研究表明,在这些分层子任务上使用思维链监督进行训练,并结合可验证奖励的强化学习,可以显著提高空间一致性和目标任务准确率。

这种分解既作为识别特定故障模式的诊断工具,也作为增强MLLMs空间推理鲁棒性的有效训练信号。