Команда Qwen опубликовала технический отчет по Qwen2, представляющий новую серию больших языковых моделей с количеством параметров от 0,5 до 72 миллиардов, включающую как плотные архитектуры, так и Mixture-of-Experts (MoE).
- Флагманская базовая модель Qwen2-72B демонстрирует результаты 84,2 на MMLU, 89,5 на GSM8K и 64,6 на HumanEval.
- Модификация Qwen2-72B-Instruct, дообученная для инструкций, достигает 9,1 на MT-Bench и 35,7 на LiveCodeBench.
- Модели обучены на более чем 7 триллионах токенов и поддерживают около 30 языков.
- Веса открыто доступны на Hugging Face и ModelScope для использования сообществом.
Цель выпуска — предоставить высокопроизводительные базовые модели, способные конкурировать с проприетарными системами, оставаясь при этом доступными для исследований и развёртывания.