Um estudo avalia seis modelos de linguagem de fronteira em uma tarefa de comunicação entre dois agentes, na qual um questionador identifica um alvo a partir de N parágrafos da Wikipedia usando exatamente log2(N) perguntas sim/não. O experimento realizou 408 jogos em conjuntos de documentos de 4 a 1024 parágrafos, revelando disparidades significativas de desempenho entre os modelos testados.
- Claude Opus venceu apenas 28 dos 68 jogos, enquanto GLM-5.3, GPT-5.6 Sol, Grok 4.6, Gemini 3.8 Flash e Kimi K3 alcançaram taxas de vitória entre 45% e 56%.
- Os cinco melhores modelos apresentaram uma queda na taxa de vitória com o tamanho do conjunto (r=-0,973), ajustando-se à fórmula win=p^(log2 N) com p=0,928.
- Os erros foram divididos igualmente entre erros de resposta e falhas de discriminação, com Claude Opus cometendo 32 dos 34 erros unânimes ao responder incorretamente "Não".
- A informação por pergunta correlacionou-se positivamente com a taxa de vitória (r=+0,88), e apenas dois modelos extraíram um bit completo por pergunta ao particionar os títulos dos documentos.
- O gasto de tokens de raciocínio variou 4,5 vezes entre os modelos, mas mostrou pouca relação com o sucesso, pois o crescimento do rastro não correspondeu aos ganhos de confiabilidade.
Os resultados indicam que, embora a maioria dos modelos líderes seja marginalmente separável neste cenário de informação assimétrica, Claude Opus tem desempenho significativamente inferior em comparação com seus pares.