Qwen 3.8 Max alcanza una puntuación de 1588 en el Debate Benchmark, superando la puntuación de 1462 de Qwen 3.7 Max. Este benchmark evalúa qué tan bien los grandes modelos de lenguaje sostienen un argumento bajo oposición adversarial y multironda en diversos temas.
- El Debate Benchmark mide el conocimiento amplio, el uso preciso de hechos bajo presión, la agudeza de las refutaciones y la coherencia a lo largo de varias rondas.
- Cada enfrentamiento se debate dos veces con los lados intercambiados para cancelar el sesgo del lado, y un panel de tres modelos decide al ganador y el margen.
- El costo promedio por debate de Qwen 3.8 Max aumentó un 45% en comparación con su predecesor.