एक अनुवर्ती अध्ययन ने क्लाउड फेबल 5 और चैटजीपीटी 5.5 का मानव टिप्पणीकार के साथ दृश्यरूपित रूपक की निहित विशेषता पर 100 दृश्यों का उपयोग करके परीक्षण किया। विश्लेषण से एलएलएम के बीच पता लगाने की सीमाओं में महत्वपूर्ण असंगतियां सामने आईं, जिसमें क्लाउड ने 78 उदाहरण और चैटजीपीटी ने 40 पहचाने, जबकि अन्य मॉडलों के लिए गिनती लगभग शून्य थी।

  • दृश्यरूपित रूपकों पर, मानव टिप्पणीकारों ने 100 उदाहरणों में से 9 पाए, जबकि ग्रॉक ने 0, जेमिनी ने ~2, चैटजीपीटी ने 40 और क्लाउड ने 78 पाए।
  • सहमति स्कोर (κ) सबसे कठिन विशेषताओं के लिए लगभग शून्य थे, जिससे संकेत मिलता है कि परिभाषा स्वयं भिन्नता में योगदान देती है।
  • अध्ययन ने उन पूर्व दावों को सुधारा था कि वातावरण विरोधाभास मशीन-प्रूफ था, क्लाउड (κ 0.27) और चैटजीपीटी (κ 0.18) के लिए मापने योग्य सहमति दिखाई दी।

डेटासेट और निर्धारक स्कोरिंग स्क्रिप्ट पुनर्गणना के लिए मॉडल की भागीदारी के बिना हगिंग फेस पर उपलब्ध हैं।