Une étude évalue six modèles de langage de pointe sur une tâche de communication à deux agents où un questionneur identifie une cible parmi N paragraphes de Wikipédia en utilisant exactement log2(N) questions par oui ou par non. L'expérience a déroulé 408 jeux sur des ensembles de documents allant de 4 à 1024 paragraphes, révélant d'importantes disparités de performance parmi les modèles testés.

  • Claude Opus n'a remporté que 28 des 68 jeux, tandis que GLM-5.3, GPT-5.6 Sol, Grok 4.6, Gemini 3.8 Flash et Kimi K3 ont atteint des taux de victoire compris entre 45 % et 56 %.
  • Les cinq meilleurs modèles ont montré un déclin du taux de victoire avec la taille de l'ensemble (r=-0,973), s'ajustant à la formule win=p^(log2 N) avec p=0,928.
  • Les erreurs étaient réparties équitablement entre les erreurs de réponse et les échecs de discrimination, Claude Opus ayant commis 32 des 34 erreurs unanimes en répondant incorrectement « Non ».
  • L'information par question était corrélée positivement avec le taux de victoire (r=+0,88), et seuls deux modèles ont extrait un bit complet par question en partitionnant sur les titres des documents.
  • La dépense en tokens de raisonnement a varié d'un facteur 4,5x entre les modèles mais a montré peu de lien avec le succès, car la croissance du trace ne correspondait pas aux gains de fiabilité.

Les résultats indiquent que, bien que la plupart des modèles leaders soient marginalement séparables dans ce cadre d'information asymétrique, Claude Opus sous-performe significativement par rapport à ses pairs.