Qwen 3.8 Max mencapai skor 1588 di Debate Benchmark, meningkatkan skor 1462 dari Qwen 3.7 Max. Benchmark ini mengevaluasi seberapa baik model bahasa besar mempertahankan argumen di bawah oposisi adversarial dan multi-tur di berbagai topik.
- Debate Benchmark mengukur pengetahuan luas, penggunaan fakta yang akurat di bawah tekanan, rebutal tajam, dan koherensi selama beberapa putaran.
- Setiap pertandingan diperdebatkan dua kali dengan sisi yang ditukar untuk membatalkan bias sisi, dan panel hakim tiga model memutuskan pemenang dan margin.
- Biaya rata-rata per debat Qwen 3.8 Max meningkat sebesar 45% dibandingkan dengan pendahulunya.