← 返回 media r/LocalLLaMA · 3 小时前 · open_models Artificial Analysis将Qwen 3.8 Max评为最佳整体模型,超越Opus 5 译自 English → 中文 Artificial Analysis更新了其智能体指数,将Qwen 3.8 Max评为最佳整体模型,将其排在Opus 5之前。 该排名基于Artificial Analysis智能体指数。Qwen 3.8 Max现在在该特定评估中位居榜首。它在当前排名中超越了Opus 5。 重要性 2/3 r/LocalLLaMA Alibaba (Qwen) Benchmark results 阅读原文 相关文章 media AI News (smol.ai) · 2 天前 · 8 次浏览 阿里巴巴发布Qwen3.8-Max,拥有2.4T参数并即将开放权重 阿里巴巴宣布推出Qwen3.8-Max作为其最新旗舰模型,描述其为专注于长周期智能体工作、编码和多模态推理的2.4T参数稀疏架构。该公司确认,Qwen3.8-Max的开源权重将于下周发布,同时还将开放Qwen3.8-27B变体的权重。 media r/LocalLLaMA · 2 天前 · 2 次浏览 Qwen 3.8 Max 在辩论基准测试中得分1588,高于Qwen 3.7 Max的1462 Qwen 3.8 Max 在辩论基准测试(Debate Benchmark)中获得1588分,优于 Qwen 3.7 Max 的1462分。该基准测试评估大型语言模型在各种主题下,面对对抗性多轮反驳时维持论点的能力。 media r/LocalLLaMA · 3 天前 · 9 次浏览 Qwen3.8-Max在基准测试中与Kimi K3和DeepSeek V4 Flash持平 Qwen3.8-Max(2.4T)是一款全新的开源权重模型,在所有基准测试类别中的表现与Kimi K3和DeepSeek V4 Flash非常接近,同时在编码和软件任务中展现出更优越的性能。 media r/LocalLLaMA · 4 天前 · 2 次浏览 Qwen 3.8-Max 发布,在 Vision Arena 中排名第 2 Qwen 3.8-Max 已发布,目前在 Vision Arena 排行榜上位列第 2,仅次于 Claude Fable 5 Max。 arxiv arXiv cs.CL · 17 天前 · 2 次浏览 Intern-BioBreaker揭示前沿大语言模型中的物理生物安全风险 研究人员开发了Intern-BioBreaker,这是一种专门的生物红队测试模型,通过将计算压力测试与湿实验验证相结合,来评估前沿大型语言模型的生物风险。研究发现,经过对齐的模型可以被诱导为安全敏感任务提供操作指导,并生成具有有害特性的序列级输出。
media AI News (smol.ai) · 2 天前 · 8 次浏览 阿里巴巴发布Qwen3.8-Max,拥有2.4T参数并即将开放权重 阿里巴巴宣布推出Qwen3.8-Max作为其最新旗舰模型,描述其为专注于长周期智能体工作、编码和多模态推理的2.4T参数稀疏架构。该公司确认,Qwen3.8-Max的开源权重将于下周发布,同时还将开放Qwen3.8-27B变体的权重。
media r/LocalLLaMA · 2 天前 · 2 次浏览 Qwen 3.8 Max 在辩论基准测试中得分1588,高于Qwen 3.7 Max的1462 Qwen 3.8 Max 在辩论基准测试(Debate Benchmark)中获得1588分,优于 Qwen 3.7 Max 的1462分。该基准测试评估大型语言模型在各种主题下,面对对抗性多轮反驳时维持论点的能力。
media r/LocalLLaMA · 3 天前 · 9 次浏览 Qwen3.8-Max在基准测试中与Kimi K3和DeepSeek V4 Flash持平 Qwen3.8-Max(2.4T)是一款全新的开源权重模型,在所有基准测试类别中的表现与Kimi K3和DeepSeek V4 Flash非常接近,同时在编码和软件任务中展现出更优越的性能。
media r/LocalLLaMA · 4 天前 · 2 次浏览 Qwen 3.8-Max 发布,在 Vision Arena 中排名第 2 Qwen 3.8-Max 已发布,目前在 Vision Arena 排行榜上位列第 2,仅次于 Claude Fable 5 Max。
arxiv arXiv cs.CL · 17 天前 · 2 次浏览 Intern-BioBreaker揭示前沿大语言模型中的物理生物安全风险 研究人员开发了Intern-BioBreaker,这是一种专门的生物红队测试模型,通过将计算压力测试与湿实验验证相结合,来评估前沿大型语言模型的生物风险。研究发现,经过对齐的模型可以被诱导为安全敏感任务提供操作指导,并生成具有有害特性的序列级输出。