アリババクラウドの独自大規模言語モデルであるQwen2.5-Maxは、技術分野において卓越した能力を持つ他のトッププロプライエタリLLMと肩を並べ、Chatbot Arenaでの総合ランキングで7位を獲得しました。

  • 数学およびコーディングベンチマークで1位を維持しています。
  • 複雑なタスクを含むハードプロンプトで2位にランクインしています。
  • Mixture of Experts (MoE) モデルとして、20兆トークン以上で事前学習され、教師ありファインチューニングと人間のフィードバックからの強化学習を経て洗練されました。
  • MMLU-Pro、LiveCodeBench、LiveBench、Arena-Hardなどの主要ベンチマークで首位のスコアを達成しました。

開発者は、アリババクラウドのModel StudioまたはQwen Chatプラットフォームを通じてQwen2.5-Maxにアクセスできます。