本文介绍了 DeepSeek V4 Flash 0731 模型在 ARC-AGI 基准测试中的结果。链接指向由 ARC Prize 组织托管的官方结果页面。
源文本中未提供其他详细信息、分数或具体发现。
本文介绍了 DeepSeek V4 Flash 0731 模型在 ARC-AGI 基准测试中的结果。链接指向由 ARC Prize 组织托管的官方结果页面。
源文本中未提供其他详细信息、分数或具体发现。
DeepSeek 发布了 DeepSeek-V4-Flash-0731,这是其较小的“Flash”模型的更新版本,在独立基准测试中超越了更大的 DeepSeek-V4-Pro。此次发布采用了一种新的微调流程,同时保留了原始的混合专家架构,总参数量为 2840 亿。
在 DeepSWE 基准测试中对 DeepSeek-V4 Flash 0731 和 GPT-5.6 Luna 进行的比较显示,虽然 GPT-5.6 Luna 是更强的工程师模型,但结合使用这两种模型的级联策略能以更低的成本实现更高的准确率。
文章宣布,DeepSeek-V4-Flash-0731模型在象棋基准测试中超越了Fable-5、Sol和Kimi-K3。
DeepSeek-V4-Flash-0731 模型达到了 50 的智能指数分数,这一指标与 2026 年 3 月顶级前沿模型的表现相匹配,当时的分数为 51。
Reddit上流传的一个翻译梗图表明,由于DeepSeek v4 flash带来的竞争压力,竞争对手不得不将价格降低80%。该开源模型拥有2840亿总参数和130亿活跃参数,提供了卓越的性价比指标。