Qwen 3.8 Max atteint un score de 1588 au Debate Benchmark, améliorant le score de 1462 de Qwen 3.7 Max. Ce benchmark évalue la capacité des grands modèles de langage à soutenir un argument face à une opposition adversariale et multiround sur divers sujets.

  • Le Debate Benchmark mesure les connaissances générales, l'utilisation précise des faits sous pression, la pertinence des répliques et la cohérence sur plusieurs tours.
  • Chaque affrontement est débattu deux fois avec les côtés échangés pour annuler le biais de côté, et un panel de trois modèles décide du gagnant et de la marge.
  • Le coût moyen par débat de Qwen 3.8 Max a augmenté de 45 % par rapport à son prédécesseur.