Qwen 3.8 MaxはDebate Benchmarkで1588点を達成し、Qwen 3.7 Maxの1462点を上回るスコアを記録しました。このベンチマークは、大規模言語モデルが様々なトピックにおいて敵対的な多ターン反対にさらされても論理を展開できる能力を評価します。

  • Debate Benchmarkは広範な知識、圧力下での正確な事実使用、鋭い反論、そして複数ラウンドにわたる一貫性を測定します。
  • 各対戦は両側を入れ替えて2回行われ、側面のバイアスを相殺するために3つのモデルで構成される審査パネルが勝者と差を決定します。
  • Qwen 3.8 Maxの1回のデベートあたりの平均コストは、前身と比較して45%増加しました。