阿里云开源了Qwen2.5系列仅解码器密集语言模型,在现有0.5B至72B参数的阵容中新增三个尺寸(3B、14B和32B)。此次更新将预训练数据集从7万亿token扩展至18万亿token,并整合了来自Qwen2.5-Coder和Qwen-math的技术突破,显著提升在编码、数学和通用知识方面的性能。
- Qwen2.5-32B模型优于Qwen2-72B,而Qwen2.5-14B在综合评估中超越Qwen2-57B-A14B。
- 知识增强体现在MMLU基准测试上,Qwen2.5-7B/72B的得分分别从70.3提升至74.2、从84.2提升至86.1。
- 编码能力大幅改善,Qwen2.5-72B-Instruct在LiveCodeBench上达到55.5,在MBPP上达到88.2。
- 数学能力显著提升,Qwen2.5-7B/72B-Instruct的MATH基准测试得分从52.9/69.0提升至75.5/83.1。
- 人类偏好对齐得到改善,Qwen2.5-72B-Instruct的Arena-Hard得分从48.1跃升至81.2。
- 上下文长度支持扩展至128K token,且大多数模型采用Apache 2.0许可证。
此次发布旨在满足用户对10-30B范围内高性价比生产模型以及移动端优化的3B模型的需求,提供具有高度竞争力的开源替代方案,其性能匹配甚至超越更大的专有系统。