一项研究对六个前沿语言模型在一个双智能体通信任务上进行了评估,其中提问方通过恰好 log2(N) 个是/否问题从 N 段维基百科段落中识别目标。实验在包含 4 到 1024 段文档的集合上运行了 408 场游戏,揭示了被测模型之间显著的性能差异。
- Claude Opus 仅在 68 场比赛中获胜 28 场,而 GLM-5.3、GPT-5.6 Sol、Grok 4.6、Gemini 3.8 Flash 和 Kimi K3 的胜率在 45% 到 56% 之间。
- 前五名模型显示出随集合大小增加胜率下降的趋势(r=-0.973),符合公式 win=p^(log2 N),其中 p=0.928。
- 错误均匀分布在答案错误和区分失败之间,Claude Opus 在 34 次一致错误中有 32 次因错误回答“否”所致。
- 每问题的信息量与胜率呈正相关(r=+0.88),仅有两个模型通过对文档标题进行划分,实现了每问题提取完整 1 bit 的信息。
- 推理令牌的消耗在不同模型间差异达 4.5 倍,但与成功程度关系不大,因为追踪增长并未匹配可靠性的提升。
结果表明,尽管大多数领先模型在此非对称信息设置中仅能勉强区分,Claude Opus 的表现显著低于其同行。