ある研究では、6つのフロンティア言語モデルが、質問者がN個のWikipediaのパラグラフからターゲットを正確にlog2(N)回のyes/no質問で特定する2エージェント間の通信タスクにおいて評価された。実験は4〜1024パラグラフのドキュメントセット全体で408ゲームを実行し、テストされたモデル間で顕著なパフォーマンスの格差が明らかになった。

  • Claude Opusは68ゲーム中わずか28勝にとどまり、GLM-5.3、GPT-5.6 Sol、Grok 4.6、Gemini 3.8 Flash、Kimi K3は45%〜56%の勝率を達成した。
  • トップ5モデルはセットサイズに対して勝率が低下し(r=-0.973)、win=p^(log2 N)(p=0.928)という式に適合した。
  • エラーは回答ミスと識別失敗で均等に分割され、Claude Opusは「No」と誤って答えることで34回の一致エラーのうち32回を犯した。
  • 質問あたりの情報は勝率と正の相関(r=+0.88)を示し、ドキュメントタイトルでパーティション分割することで1質問あたり完全な1ビットを抽出できたのはわずか2つのモデルのみだった。
  • 推論トークンの消費量はモデル間で4.5倍変動したが、成功との関連はほとんどなく、トレースの成長が信頼性の向上と一致しなかったためである。

結果は、この非対称情報設定では主要なモデルの多くがわずかに分離可能である一方、Claude Opusは他社と比較して著しく下回るパフォーマンスを示したことを示している。