Qwen团队发布了QwQ-32B-Preview,这是一款旨在通过深度反思和自我提问来推进AI推理能力的实验性研究模型。该预览版重点提升数学和编程方面的分析能力。
- 该模型在GPQA上达到65.2%,在AIME上达到50.0%,在MATH-500上达到90.6%,在LiveCodeBench上达到50.0%。
- 它在提供答案之前,会经过深思熟虑并审视自身的假设。
- 局限性包括可能的语言混合、递归推理循环以及需要加强安全措施。
此次发布是探索耐心探究如何推动解决复杂技术问题突破的早期一步。
Qwen团队发布了QwQ-32B-Preview,这是一款旨在通过深度反思和自我提问来推进AI推理能力的实验性研究模型。该预览版重点提升数学和编程方面的分析能力。
此次发布是探索耐心探究如何推动解决复杂技术问题突破的早期一步。
| Benchmark | 模型 | 得分 |
|---|---|---|
| GPQA Diamond | QwQ-32B-Preview | 65.2% |
| AIME 2024 | QwQ-32B-Preview | 50% |
| LiveCodeBench | QwQ-32B-Preview | 50% |
| MATH-500 | QwQ-32B-Preview | 90.6% |
Qwen发布了Qwen3-235B-A22B-Thinking-2507模型,这是其专为复杂推理任务设计的235B参数混合专家架构的更新版本。该版本在逻辑推理、数学、科学和编码基准测试中表现出显著增强的性能,在开源思维模型中达到了最先进水平。
阿里巴巴Qwen团队发布了Qwen-Image-2.1,这是一个统一的文本到图像生成和图像编辑模型,将之前独立的检查点整合为一个拥有70亿参数的扩散Transformer。
Qwen 发布了开源权重的 Qwen-Image-2.1,这是一款专为图像生成和编辑设计的统一模型。
阿里巴巴发布了一款开源医疗人工智能模型,能够检测癌症以及大约150种其他医疗状况。
Sberbank的AI Sage发布了GigaChat-3.5 Reasoning,这是一个432B-A28B混合专家(MoE)模型,利用Gated DeltaNet实现长上下文效率。
我们使用 Cookie 来统计访问量并改进网站。您可以接受或拒绝分析 Cookie。 隐私政策