Un estudio evalúa seis modelos de lenguaje de vanguardia en una tarea de comunicación entre dos agentes donde un interrogador identifica un objetivo a partir de N párrafos de Wikipedia utilizando exactamente log2(N) preguntas de sí/no. El experimento ejecutó 408 juegos en conjuntos de documentos de 4 a 1024 párrafos, revelando disparidades significativas en el rendimiento entre los modelos evaluados.

  • Claude Opus ganó solo 28 de 68 juegos, mientras que GLM-5.3, GPT-5.6 Sol, Grok 4.6, Gemini 3.8 Flash y Kimi K3 lograron tasas de victoria entre el 45% y el 56%.
  • Los cinco primeros modelos mostraron una disminución en la tasa de victoria con el tamaño del conjunto (r=-0.973), ajustándose a la fórmula win=p^(log2 N) con p=0.928.
  • Los errores se dividieron equitativamente entre errores de respuesta y fallos de discriminación, con Claude Opus cometiendo 32 de los 34 errores unánimes al responder incorrectamente "No".
  • La información por pregunta se correlacionó positivamente con la tasa de victoria (r=+0.88), y solo dos modelos extrajeron un bit completo por pregunta mediante la partición en títulos de documentos.
  • El gasto de tokens de razonamiento varió 4.5 veces entre los modelos pero mostró poca relación con el éxito, ya que el crecimiento del rastro no coincidió con las ganancias de fiabilidad.

Los resultados indican que, aunque la mayoría de los modelos líderes son marginalmente separables en este entorno de información asimétrica, Claude Opus tiene un rendimiento significativamente inferior en comparación con sus pares.