QwenチームはQwen2技術レポートを発表し、0.5億から720億パラメータに及ぶ新しい大規模言語モデル(LLM)シリーズを紹介しました。これにはDenseアーキテクチャとMixture-of-Experts (MoE) アーキテクチャの両方が含まれます。

  • フラッグシップのQwen2-72Bベースモデルは、MMLUで84.2、GSM8Kで89.5、HumanEvalで64.6のスコアを達成しました。
  • インストラクションチューニング済みのQwen2-72B-Instructバリアントは、MT-Benchで9.1、LiveCodeBenchで35.7に達しました。
  • モデルは7兆トークン以上でトレーニングされ、約30の言語をサポートしています。
  • ウェイトはHugging FaceおよびModelScopeでコミュニティ利用のために公開されています。

今回のリリースは、研究やデプロイメントのためにアクセス可能でありながら、プロプライエタリなシステムと競争できる高性能な基盤モデルを提供することを目的としています。