← 返回 media r/LocalLLaMA · 1 小时前 · open_models DeepSeek-V4-Flash-0731在基准测试中超越DeepSeek-V4-Pro-Preview 译自 English → 中文 DeepSeek-V4-Flash-0731模型在各种基准测试中显著优于DeepSeek-V4-Pro-Preview。 此次更新标志着Flash变体与Pro预览版相比,性能指标发生了显著变化。 重要性 2/3 r/LocalLLaMA DeepSeek Benchmark results 阅读原文 相关文章 media r/LocalLLaMA · 2 小时前 DeepSeek V4-Flash在ArtificialAnalysis指数中达到50分 新的DeepSeek V4-Flash模型在ArtificialAnalysis指数中获得了50分的成绩。这一成绩使其仅比GLM-5.2和GPT-5.6 Luna低一分。 media r/LocalLLaMA · 2 小时前 DeepSeek-V4-Flash-0731 以相同成本超越 GLM 5.2 DeepSeek-V4-Flash-0731 模型在保持与前任相同定价的同时,性能优于 GLM 5.2。 media r/LocalLLaMA · 3 小时前 DeepSeek V4 Flash 更新,Terminal Bench 和 Toolathlon 得分提升 DeepSeek 已更新其 V4 Flash 模型,于 2026-07-31 发布新版本,相比之前的预览版性能显著提升。此次更新引入了多个新基准测试的结果,并提升了现有基准的得分。 media MarkTechPost · 12 天前 · 9 次浏览 Kimi K3、DeepSeek V4 Pro 和 GLM-5.2 在基准测试、许可证和服务成本方面的对比 对三种开源稀疏混合专家模型——月之暗面的 Kimi K3、DeepSeek V4 Pro 以及智谱 AI 的 GLM-5.2——进行了比较,评估了它们在长周期编码和智能体工作负载方面的能力、许可条款及服务成本。 media r/LocalLLaMA · 16 天前 DeepSeek V4 通过一次性编程生成《无人深空》与《我的世界》混合体 一位通过 A/B 测试获得新版 DeepSeek V4 访问权限的用户,仅使用一次性编程成功创建了一款结合《无人深空》和《我的世界》元素的混合游戏。 生成的源代码和聊天记录已公开分享,展示了该模型在此特定上下文中的能力。 这一演示作为反驳论点,针对那些声称一次性编程对基准测试毫无用处的说法。
media r/LocalLLaMA · 2 小时前 DeepSeek V4-Flash在ArtificialAnalysis指数中达到50分 新的DeepSeek V4-Flash模型在ArtificialAnalysis指数中获得了50分的成绩。这一成绩使其仅比GLM-5.2和GPT-5.6 Luna低一分。
media r/LocalLLaMA · 2 小时前 DeepSeek-V4-Flash-0731 以相同成本超越 GLM 5.2 DeepSeek-V4-Flash-0731 模型在保持与前任相同定价的同时,性能优于 GLM 5.2。
media r/LocalLLaMA · 3 小时前 DeepSeek V4 Flash 更新,Terminal Bench 和 Toolathlon 得分提升 DeepSeek 已更新其 V4 Flash 模型,于 2026-07-31 发布新版本,相比之前的预览版性能显著提升。此次更新引入了多个新基准测试的结果,并提升了现有基准的得分。
media MarkTechPost · 12 天前 · 9 次浏览 Kimi K3、DeepSeek V4 Pro 和 GLM-5.2 在基准测试、许可证和服务成本方面的对比 对三种开源稀疏混合专家模型——月之暗面的 Kimi K3、DeepSeek V4 Pro 以及智谱 AI 的 GLM-5.2——进行了比较,评估了它们在长周期编码和智能体工作负载方面的能力、许可条款及服务成本。
media r/LocalLLaMA · 16 天前 DeepSeek V4 通过一次性编程生成《无人深空》与《我的世界》混合体 一位通过 A/B 测试获得新版 DeepSeek V4 访问权限的用户,仅使用一次性编程成功创建了一款结合《无人深空》和《我的世界》元素的混合游戏。 生成的源代码和聊天记录已公开分享,展示了该模型在此特定上下文中的能力。 这一演示作为反驳论点,针对那些声称一次性编程对基准测试毫无用处的说法。