LiveBench 基准测试平台已将其评估套件中加入了 DeepSeek v4.1 Flash 模型。
- 该模型被描述为性能与 5.6 Sol 模型相当。
- 值得注意的是,在其评估中,它的价格不到对比模型的十分之一。
LiveBench 基准测试平台已将其评估套件中加入了 DeepSeek v4.1 Flash 模型。
Reddit 上有一篇题为“Qwen3.8-Flash-Next 优于 DeepSeek V4 Pro”的帖子,由用户 /u/Normal-Phone7762 提交至 r/LocalLLaMA 社区。
在 DeepSWE 基准测试中对 DeepSeek V4 Pro 0813 和 Claude Fable 5 进行比较显示,使用这两种模型的路由策略以每个任务 8.28 美元的成本解决了 82.7% 的任务,优于单独使用 Fable(69.7%),且成本显著更低。
在 DeepSWE 基准测试中,对 DeepSeek V4 Pro 0813 和 GPT-5.6 Sol 进行的比较表明,先运行 DeepSeek,并在测试失败时升级到 GPT-5.6 Sol,可在每个任务成本为 3.35 美元的情况下实现 83.0% 的通过率。
Artificial Analysis 发布了针对 Qwen3.8-27B 模型的基准测试结果,将其性能与 DeepSeek V4 和 GPT-5.6 Luna Max 进行了直接比较。
一位 Reddit 用户强调了 DeepSeek DSv4 Flash 0731 模型,指出其相对于成本的强大性能。该帖子引用了 Artificial Analysis Intelligence Index v4.1.1 来支持该模型表现出色的说法。
我们使用 Cookie 来统计访问量并改进网站。您可以接受或拒绝分析 Cookie。 隐私政策