اختبرت دراسة متابعة كلاود فابل 5 وتاتش جي بي تي 5.5 مقابل مُعلِّم بشري في السمة الاستنتاجية للاستعارات المادية باستخدام 100 مشهد. وكشفت التحليلات عن فروقات كبيرة في عتبات الكشف بين نماذج اللغات الكبيرة، حيث حدد كلاود 78 حالة وتاتش جي بي تي 40، مقارنةً بأعداد قريبة من الصفر للنماذج الأخرى.

  • بالنسبة للاستعارات المادية، وجد المُعلِّمون البشريون 9 من أصل 100 حالة، بينما وجد غروك 0، وجيميني حوالي 2، وتاتش جي بي تي 40، وكلاود 78.
  • كانت درجات الاتفاق (κ) قريبة من الصفر لأصعب السمات، مما يشير إلى أن التعريف نفسه يساهم في التباين.
  • تصحح الدراسة الادعاءات السابقة التي مفادها أن تناقض الأجواء كان محصناً ضد الآلة، إذ أظهرت اتقانا قابلاً للقياس لكلاود (κ 0.27) وتاتش جي بي تي (κ 0.18).

مجموعة البيانات وسكربت التقييم الحتمي متاحان على هيغينغ فيس لإعادة الحساب دون مشاركة النموذج.