Qwen 3.8 Max 在辩论基准测试(Debate Benchmark)中获得1588分,优于 Qwen 3.7 Max 的1462分。该基准测试评估大型语言模型在各种主题下,面对对抗性多轮反驳时维持论点的能力。

  • 辩论基准测试衡量广泛的知识、在压力下的准确事实使用、犀利的反驳能力以及多轮对话中的连贯性。
  • 每场对决进行两次辩论并交换立场以抵消立场偏差,由三名模型组成的评审团决定胜者和分差。
  • Qwen 3.8 Max 每次辩论的平均成本比其前身增加了45%。