Qwen2.5技术报告详细介绍了包含开放权重密集变体和专有混合专家(MoE)模型的全面大型语言模型系列的发布。此次更新将预训练数据从7万亿个token大幅扩展至18万亿个,并通过监督微调和强化学习使用超过100万个样本进行后训练。

  • 开放权重密集模型提供0.5B、1.5B、3B、7B、14B、32B和72B参数规模。
  • 专有MoE模型Qwen2.5-Turbo和Qwen2.5-Plus可通过阿里云Model Studio获取。
  • 旗舰版Qwen2.5-72B-Instruct在参数量仅为Llama-3-405B-Instruct五分之一的情况下,性能与之相当。
  • 上下文长度支持从2K token增加至8K token,其中Qwen2.5-Turbo支持高达100万个token。

这些改进旨在为各种用例提供具有成本效益的解决方案,同时在推理、编码和数学基准测试中保持顶级性能。