QwenチームはQwen1.5から進化し、5つの新しいモデルサイズ(Qwen2-0.5B、Qwen2-1.5B、Qwen2-7B、Qwen2-57B-A14B、Qwen2-72B)を備えたQwen2シリーズをリリースしました。これらのモデルは現在、Hugging FaceおよびModelScopeで利用可能です。

  • すべてのモデルサイズは、推論の高速化とメモリ使用量の削減のためにグループクエリアテンション(GQA)を採用しています。
  • 訓練データには英語と中国語に加えて27言語が追加され、多言語能力が向上しました。
  • Qwen2-7B-InstructおよびQwen2-72B-InstructはYARNを使用して最大128Kトークンの拡張コンテキスト長をサポートします。
  • Qwen2-72Bモデルはパラメータ数が少ないにもかかわらず、Llama-3-70Bおよびその前身であるQwen1.5-110Bと比較して優れたパフォーマンスを示しています。
  • コーディング、数学、安全アライメントにおいて、自動化されたポストトレーニング戦略を通じて大幅な改善が行われました。

今回のリリースは、自然言語理解、推論、多言語タスクにおいて最先端のパフォーマンスを提供しつつ、強力な安全基準を維持するオープンソースモデルを提供することを目的としています。