O Qwen 3.8 Max alcançou uma pontuação de 1588 no Debate Benchmark, superando a pontuação de 1462 do Qwen 3.7 Max. Este benchmark avalia o quão bem os grandes modelos de linguagem sustentam um argumento sob oposição adversarial e multironda em vários tópicos.
- O Debate Benchmark mede conhecimento amplo, uso preciso de fatos sob pressão, refutação afiada e coerência ao longo de várias rodadas.
- Cada confronto é debatido duas vezes com os lados trocados para cancelar o viés do lado, e um painel de três modelos decide o vencedor e a margem.
- O custo médio por debate do Qwen 3.8 Max aumentou 45% em comparação com seu predecessor.