أطلق باحثو إنفيديا إطار Spatial-IQ التشخيصي المصمم لتحليل الذكاء المكاني للنماذج اللغوية الكبيرة متعددة الوسائط (MLLMs). وعلى عكس المقاييس الحالية التي تعامل النماذج كصناديق سوداء، يقوم هذا النهج بتحليل عدّ الأجسام في الهياكل ثلاثية الأبعاد المتراكمة إلى تسعة مهام فرعية إدراكية ومعرفية متوافقة مع مراحل النمو البشري.

  • يستخدم الإطار إنفيديا آيزاك سيم لتوليد مجموعة بيانات إجرائية تضم حوالي 80,000 هيكل ثلاثي الأبعاد متراكب، مع وجود الحقيقة الأساسية لكل مهمة فرعية.
  • تكشف التقييمات عبر النصوص ذات الاستجابة الحرة، والصور متعددة الخيارات، وتنسيقات تعديل الصور أن النماذج الأعلى أداءً غالباً ما تنجح في المهام المستهدفة بينما تفشل في المهام الفرعية الأدنى مستوى، مما يشير إلى سلوك اختياري.
  • تُظهر الدراسة أن التدريب باستخدام إشراف سلسلة التفكير على هذه المهام الفرعية الهرمية، مقترناً بتعزيز التعلم مع مكافآت قابلة للتحقق، يحسّن بشكل كبير من الاتساق المكاني ودقة المهمة المستهدفة.

يعمل هذا التحليل ككلٍ أداة تشخيصية لتحديد أنماط الفشل المحددة وإشارة تدريب فعالة لتعزيز متانة الاستدلال المكاني في النماذج اللغوية الكبيرة متعددة الوسائط.