Исследование оценивает шесть языковых моделей уровня Frontier в задаче коммуникации двух агентов, где отвечающий на вопросы определяет цель из N абзацев Википедии, используя ровно log2(N) вопросов с ответами «да»/«нет». Эксперимент провёл 408 игр на наборах документов от 4 до 1024 абзацев, выявив значительные различия в производительности среди протестированных моделей.
- Claude Opus выиграл лишь 28 из 68 игр, тогда как GLM-5.3, GPT-5.6 Sol, Grok 4.6, Gemini 3.8 Flash и Kimi K3 достигли доли побед от 45% до 56%.
- Топовые пять моделей показали снижение доли побед с увеличением размера набора (r=-0.973), что соответствует формуле win=p^(log2 N) при p=0.928.
- Ошибки поровну распределились между неверными ответами и ошибками дискриминации, при этом Claude Opus допустил 32 из 34 единогласных ошибок, неправильно ответив «Нет».
- Информация на вопрос положительно коррелировала с долей побед (r=+0.88), и лишь две модели извлекали полный бит на вопрос за счёт разделения по названиям документов.
- Расход токенов рассуждения варьировался в 4,5 раза между моделями, но слабо связан с успехом, так как рост трассы не соответствовал росту надёжности.
Результаты показывают, что хотя большинство ведущих моделей лишь слегка различимы в этой асимметричной информационной настройке, Claude Opus значительно уступает своим коллегам.