NVIDIA के शोधकर्ताओं ने Spatial-IQ का परिचय दिया है, जो मल्टीमोडल लार्ज लैंग्वेज मॉडल्स (MLLMs) की स्थानिक बुद्धिमत्ता को तोड़ने के लिए डिज़ाइन किया गया एक निदान ढांचा है। मौजूदा बेंचमार्क्स के विपरीत जो मॉडल्स को ब्लैक बॉक्स के रूप में मानते हैं, यह दृष्टिकोण स्टैक्ड 3D संरचनाओं में वस्तु गिनती को मानव विकास चरणों से सुसंगत नौ संवेदी और संज्ञानात्मक उप-कार्यों में विभाजित करता है।
- ढांचा NVIDIA Isaac Sim का उपयोग करके प्रत्येक उप-कार्य के लिए भू-सत्य (ground truth) के साथ लगभग 80,000 स्टैक्ड 3D संरचनाओं का एक डेटासेट क्रमिक रूप से उत्पन्न करता है।
- मुक्त-प्रतिक्रिया पाठ, बहुविकल्पीय छवियों और छवि संपादन प्रारूपों में मूल्यांकन दर्शाते हैं कि शीर्ष-प्रदर्शन करने वाले मॉडल अक्स लक्ष्य कार्यों में सफल होते हैं लेकिन निचले स्तर के उप-कार्यों में विफल रहते हैं, जो संक्षिप्त मार्ग व्यवहार को इंगित करता है।
- अध्ययन दिखाता है कि इन पदानुक्रमित उप-कार्यों पर चेन-ऑफ़-थॉट सुपरविजन के साथ प्रशिक्षण, सत्यापनीय पुरस्कारों के साथ पुनर्बल सीखने (reinforcement learning) के संयोजन से स्थानिक संगतता और लक्ष्य-कार्य सटीकता दोनों में महत्वपूर्ण सुधार होता है।
यह विभाजन एक निदान उपकरण के रूप में विशिष्ट विफलता मोड की पहचान करने और MLLMs में स्थानिक तर्क की मजबूती को बढ़ाने के लिए एक प्रभावी प्रशिक्षण संकेत दोनों के रूप में कार्य करता है।