Qwen 3.8 Max ने Debate Benchmark में 1588 का स्कोर प्राप्त किया, जिसने Qwen 3.7 Max के 1462 के स्कोर को बेहतर बनाया। यह बेंचमार्क इस बात का मूल्यांकन करता है कि विभिन्न विषयों पर प्रतिद्वंद्वी, बहु-चरण वाली विरोधता के तहत बड़े भाषा मॉडल कितनी अच्छे से तर्क को बनाए रखते हैं।

  • Debate Benchmark व्यापक ज्ञान, दबाव के तहत सटीक तथ्यों का उपयोग, तीक्ष्ण प्रत्युत्तर और कई राउंडों में सुसंगतता को मापता है।
  • हर मुकाबला दो बार बहस किया जाता है जिसमें पक्ष बदल दिए जाते हैं ताकि पक्ष की पूर्वाग्रह को रद्द किया जा सके, और तीन मॉडलों की जज पैनल विजेता और अंतर का निर्णय करती है।
  • Qwen 3.8 Max के प्रति बहस औसत लागत अपने पूर्ववर्ती की तुलना में 45% बढ़ गई।