Команда Qwen опубликовала технический отчет по Qwen2, представляющий новую серию больших языковых моделей с количеством параметров от 0,5 до 72 миллиардов, включающую как плотные архитектуры, так и Mixture-of-Experts (MoE).

  • Флагманская базовая модель Qwen2-72B демонстрирует результаты 84,2 на MMLU, 89,5 на GSM8K и 64,6 на HumanEval.
  • Модификация Qwen2-72B-Instruct, дообученная для инструкций, достигает 9,1 на MT-Bench и 35,7 на LiveCodeBench.
  • Модели обучены на более чем 7 триллионах токенов и поддерживают около 30 языков.
  • Веса открыто доступны на Hugging Face и ModelScope для использования сообществом.

Цель выпуска — предоставить высокопроизводительные базовые модели, способные конкурировать с проприетарными системами, оставаясь при этом доступными для исследований и развёртывания.