Qwen团队发布了Qwen2系列,从Qwen1.5演进而来,包含五种新的模型尺寸:Qwen2-0.5B、Qwen2-1.5B、Qwen2-7B、Qwen2-57B-A14B和Qwen2-72B。这些模型现已在Hugging Face和ModelScope上提供。
- 所有模型尺寸均使用Group Query Attention (GQA)以实现更快的推理速度和降低内存占用。
- 训练数据在英语和中文之外增加了27种语言,以增强多语言能力。
- Qwen2-7B-Instruct和Qwen2-72B-Instruct通过YARN支持长达128K token的扩展上下文长度。
- Qwen2-72B模型在参数量少于Llama-3-70B及其前身Qwen1.5-110B的情况下,展现出更优越的性能。
- 通过自动化的后训练策略,在编码、数学和安全对齐方面取得了显著改进。
此次发布旨在提供开源模型,在自然语言理解、推理和多语言任务中实现最先进的性能,同时保持高标准的安全性。