阿里巴巴云专有的大型语言模型Qwen2.5-Max在Chatbot Arena的综合排名中位列第7,凭借在技术领域卓越的能力与其他顶级专有LLM并驾齐驱。
- 它在数学和代码基准测试中排名第一。
- 该模型在涉及复杂任务的困难提示(hard prompts)方面排名第二。
- 作为混合专家(MoE)模型,它使用了超过20万亿个token进行预训练,并通过监督微调(SFT)和人类反馈强化学习(RLHF)进行了优化。
- 它在MMLU-Pro、LiveCodeBench、LiveBench和Arena-Hard等主要基准测试中取得了领先分数。
开发者可以通过阿里云的Model Studio或Qwen Chat平台访问Qwen2.5-Max。