《Qwen3技术报告》介绍了Qwen模型系列的最新版本,采用密集架构和混合专家(MoE)架构,参数量从0.6亿到2350亿不等。一项关键创新是将用于复杂推理的思维模式和用于快速响应的非思维模式整合到一个统一框架中,从而消除了在不同模型之间切换的需求。
- Qwen3引入了思维预算机制,允许用户在推理过程中自适应地分配计算资源,以平衡延迟和性能。
- 该模型系列在代码生成、数学推理和智能体任务等多样化基准测试中取得了最先进的结果。
- 与 predecessor Qwen2.5相比,多语言支持从29种扩展至119种语言和方言。
- 所有Qwen3模型均在Apache 2.0许可下公开可用,以促进可复现性和社区驱动的研究。
这种统一方法使用户查询能够动态切换模式,而扩展的语言支持通过改进的跨语言理解增强了全球可访问性。