تقيّم دراسة ستة نماذج لغوية حدودية عليا في مهمة اتصال بين وكيلين، حيث يحدد مُطرح الأسئلة هدفاً من بين N فقرة من ويكيبيديا باستخدام بالضبط log2(N) من أسئلة نعم/لا. جرت التجربة على 408 لعبة عبر مجموعات وثائق تتراوح من 4 إلى 1024 فقرة، وكشفت عن تفاوتات أداء كبيرة بين النماذج المختبرة.
- فاز Claude Opus بـ 28 لعبة فقط من أصل 68، بينما حققت GLM-5.3 وGPT-5.6 Sol وGrok 4.6 وGemini 3.8 Flash وKimi K3 معدلات فوز تتراوح بين 45% و56%.
- أظهرت النماذج الخمسة الأعلى انخفاضاً في معدل الفوز مع حجم المجموعة (r=-0.973)، مما يتوافق مع الصيغة win=p^(log2 N) حيث p=0.928.
- قُسّمت الأخطاء بالتساوي بين أخطاء الإجابات وفشل التمييز، حيث ارتكب Claude Opus 32 من أصل 34 خطأً إجماعياً بالإجابة بشكل غير صحيح بـ "لا".
- ارتبطت المعلومات لكل سؤال ارتباطاً طفيفاً بمعدل الفوز (r=+0.88)، ولم يستخرج سوى نموذجين بتاً كاملاً لكل سؤال عبر التقسيم بناءً على عناوين الوثائق.
- تباين إنفاق رموز الاستدلال بنسبة 4.5x بين النماذج، لكنه أظهر علاقة ضئيلة بالنجاح، إذ لم يتطابق نمو المسار مع مكاسب الموثوقية.
تشير النتائج إلى أنه بينما يمكن فصل معظم النماذج الرائدة بشكل هامشي في هذا الإعداد ذي المعلومات غير المتكافئة، فإن Claude Opus يقل أداءه بشكل ملحوظ مقارنة بنظرائه.