新的DeepSeek V4-Flash模型在ArtificialAnalysis指数中获得了50分的成绩。这一成绩使其仅比GLM-5.2和GPT-5.6 Luna低一分。
media
r/LocalLLaMA
·
46 天前
·
open_models
DeepSeek V4-Flash在ArtificialAnalysis指数中达到50分
译自 English → 中文
Benchmarks
| Benchmark | 模型 | 得分 |
|---|---|---|
| Artificial Analysis Intelligence Index | DeepSeek V4-Flash | 50% |
相关文章
media
MarkTechPost
·
58 天前
·
43 次浏览
Kimi K3、DeepSeek V4 Pro 和 GLM-5.2 在基准测试、许可证和服务成本方面的对比
对三种开源稀疏混合专家模型——月之暗面的 Kimi K3、DeepSeek V4 Pro 以及智谱 AI 的 GLM-5.2——进行了比较,评估了它们在长周期编码和智能体工作负载方面的能力、许可条款及服务成本。
media
r/LocalLLaMA
·
19 小时前
·
3 次浏览
Base-10的Charlie O'Neill认为Kimi和GLM优于Opus 5
Base-10的Charlie O'Neill在最近一期与Dwarkesh Patel合作的节目中讨论了为什么Kimi和GLM模型“几乎客观上”优于Opus 5。
media
r/LocalLLaMA
·
2 天前
·
3 次浏览
DeepSeek V4.1 Flash 登顶 Artificial Analysis Intelligence Index v4.3
DeepSeek V4.1 Flash 在 Artificial Analysis Intelligence Index v4.3 更新中,于新的 Astra 基准测试中夺得第一名。
media
r/LocalLLaMA
·
5 天前
·
4 次浏览
LiveBench 新增 DeepSeek v4.1 Flash
LiveBench 基准测试平台已将其评估套件中加入了 DeepSeek v4.1 Flash 模型。
media
Together AI Blog
·
18 天前
·
27 次浏览
GLM-5.3 Flash 蒸馏以一致性换取17倍成本降低
在DeepSWE基准测试上对GLM-5.3及其蒸馏变体GLM-5.3 Flash的比较显示,蒸馏保留了核心编码能力,同时显著降低了 rollout 成本。完整模型在每个任务上的 pass@1 速率为69.0%,成本为$3.99;而Flash变体的得分仅为63.4%,成本低至$0.24,实现了17倍的价格降低。