एक अध्ययन में छह सीमांत भाषा मॉडल का दो-एजेंट संचार कार्य पर मूल्यांकन किया गया, जहां एक प्रश्नकर्ता log2(N) हां/नहीं प्रश्नों का उपयोग करके N विकिपीडिया अनुच्छेदों से एक लक्ष्य की पहचान करता है। 4 से 1024 अनुच्छेदों वाले दस्तावेज़ सेट पर 408 खेल चलाए गए, जिसमें परीक्षण किए गए मॉडल के बीच महत्वपूर्ण प्रदर्शन अंतर सामने आया।
- क्लॉडे ओपस ने 68 में से केवल 28 खेल जीते, जबकि GLM-5.3, GPT-5.6 Sol, Grok 4.6, Gemini 3.8 Flash और Kimi K3 ने 45% से 56% के बीच की जीत दर हासिल की।
- शीर्ष पांच मॉडल में सेट आकार के साथ जीत दर में कमी दिखाई (r=-0.973), जो p=0.928 के साथ win=p^(log2 N) सूत्र पर फिट बैठती है।
- त्रुटियां उत्तर गलतियों और भेदभाव विफलताओं में समान रूप से बंटी थीं, जिसमें क्लॉडे ओपस ने 34 एकमत त्रुटियों में से 32 "नहीं" का गलत उत्तर देकर की थीं।
- प्रश्न प्रति जानकारी जीत दर के साथ सकारात्मक रूप से सहसंबद्ध थी (r=+0.88), और केवल दो मॉडल ने दस्तावेज़ शीर्षकों पर विभाजन करके प्रत्येक प्रश्न के लिए एक पूर्ण बिट निकाला।
- तर्क टोकन खपत मॉडल के बीच 4.5x तक भिन्न थी, लेकिन सफलता से कम संबंध दिखाया, क्योंकि ट्रैस वृद्धि विश्वसनीयता लाभों से मेल नहीं खाती थी।
परिणाम संकेत करते हैं कि जबकि अधिकांश अग्रणी मॉडल इस असममित जानकारी वाले सेटिंग में सीमांत रूप से पृथक हैं, क्लॉडे ओपस अपने सहकर्मियों की तुलना में काफी कम प्रदर्शन करता है।