Команда Qwen выпустила серию Qwen2, развивающуюся от Qwen1.5 с пятью новыми размерами моделей: Qwen2-0.5B, Qwen2-1.5B, Qwen2-7B, Qwen2-57B-A14B и Qwen2-72B. Эти модели теперь доступны на Hugging Face и ModelScope.

  • Все размеры моделей используют Group Query Attention (GQA) для ускорения вывода и снижения потребления памяти.
  • Обучающие данные включают 27 дополнительных языков помимо английского и китайского для улучшения многоязычных возможностей.
  • Qwen2-7B-Instruct и Qwen2-72B-Instruct поддерживают расширенную длину контекста до 128K токенов с использованием YARN.
  • Модель Qwen2-72B демонстрирует превосходные результаты по сравнению с Llama-3-70B и её предшественником Qwen1.5-110B, несмотря на меньшее количество параметров.
  • Значительные улучшения были достигнуты в области программирования, математики и безопасности благодаря автоматизированным стратегиям постобучения.

Цель выпуска — предоставить модели с открытым исходным кодом, обеспечивающие передовые результаты в задачах понимания естественного языка, рассуждений и многоязычной обработки, сохраняя при этом высокие стандарты безопасности.