Qwen2.5技術レポートは、オープンウェイトの密集型バリアントと独自開発の混合专家(MoE)モデルを特徴とする包括的な大規模言語モデルシリーズのリリースについて詳述しています。このアップデートにより、事前学習データは7兆トークンから18兆トークンに大幅にスケールし、教師ありファインチューニングおよび強化学習によるポストトレーニングのために100万サンプル以上が採用されています。
- オープンウェイトの密集型モデルは、0.5B、1.5B、3B、7B、14B、32B、72Bパラメータのサイズで利用可能です。
- 独自開発のMoEモデルであるQwen2.5-TurboおよびQwen2.5-Plusは、Alibaba Cloud Model Studioを通じて提供されています。
- フラッグシップのQwen2.5-72B-Instructは、5分の1のサイズでありながらLlama-3-405B-Instructと同等のパフォーマンスを発揮します。
- コンテキスト長のサポートが2Kトークンから8Kトークンに増加し、Qwen2.5-Turboは最大100万トークンをサポートします。
これらの改善は、推論、コーディング、数学のベンチマークでトップティアのパフォーマンスを維持しつつ、多様なユースケースに対してコスト効果の高いソリューションを提供することを目指しています。