Qwen 3.8 Max достиг результата 1588 баллов на Debate Benchmark, улучшив показатель Qwen 3.7 Max, который составил 1462 балла. Этот бенчмарк оценивает, насколько хорошо большие языковые модели удерживают аргументацию в условиях состязательной многошаговой оппозииции по различным темам.

  • Debate Benchmark измеряет широкие знания, точное использование фактов под давлением, остроту контраргументов и связность на протяжении нескольких раундов.
  • Каждая пара дебатирует дважды с обменом сторонами для устранения предвзятости стороны, а панель из трех моделей определяет победителя и разницу в баллах.
  • Средняя стоимость одного дебата для Qwen 3.8 Max увеличилась на 45% по сравнению с его предшественником.