Qwen 3.8 Max는 Debate Benchmark에서 1588점을 달성하여 Qwen 3.7 Max의 1462점 점수를 개선했습니다. 이 벤치마크는 다양한 주제에 대해 적대적이고 다중 턴의 반대 상황에서도 대규모 언어 모델이 주장을 얼마나 잘 유지하는지 평가합니다.
- Debate Benchmark는 광범위한 지식, 압력 하에서의 정확한 사실 사용, 날카로운 반박, 그리고 여러 라운드에 걸친 일관성을 측정합니다.
- 각 대결은 양측을 바꾸어 두 번 진행하여 편향을 상쇄하며, 3명의 모델로 구성된 심사단이 승자와 차이를 결정합니다.
- Qwen 3.8 Max의 평균 논쟁 비용은 전작 대비 45% 증가했습니다.