DeepSeek V4 Flash 0731 在 ARC-AGI 上的结果
本文介绍了 DeepSeek V4 Flash 0731 模型在 ARC-AGI 基准测试中的结果。链接指向由 ARC Prize 组织托管的官方结果页面。
本文介绍了 DeepSeek V4 Flash 0731 模型在 ARC-AGI 基准测试中的结果。链接指向由 ARC Prize 组织托管的官方结果页面。
DeepSeek 发布了 DeepSeek-V4-Flash-0731,这是其较小的“Flash”模型的更新版本,在独立基准测试中超越了更大的 DeepSeek-V4-Pro。此次发布采用了一种新的微调流程,同时保留了原始的混合专家架构,总参数量为 2840 亿。
在 DeepSWE 基准测试中对 DeepSeek-V4 Flash 0731 和 GPT-5.6 Luna 进行的比较显示,虽然 GPT-5.6 Luna 是更强的工程师模型,但结合使用这两种模型的级联策略能以更低的成本实现更高的准确率。
Artificial Analysis更新了其智能体指数,将Qwen 3.8 Max评为最佳整体模型,将其排在Opus 5之前。
作者指出,SciCode 基准上分数停滞的原因在于评估工具存在重大缺陷,而非模型能力的局限。对 65 个测试问题的领域专家审计发现了 263 个缺陷,其中 192 个因不可复现的标准答案和过紧的容差等问题导致正确解法被错误拒绝。
阿里巴巴宣布推出Qwen3.8-Max作为其最新旗舰模型,描述其为专注于长周期智能体工作、编码和多模态推理的2.4T参数稀疏架构。该公司确认,Qwen3.8-Max的开源权重将于下周发布,同时还将开放Qwen3.8-27B变体的权重。
Qwen 3.8 Max 在辩论基准测试(Debate Benchmark)中获得1588分,优于 Qwen 3.7 Max 的1462分。该基准测试评估大型语言模型在各种主题下,面对对抗性多轮反驳时维持论点的能力。
一项针对开源权重模型在复杂智能体任务上的内部评估发现,DeepSeek v4 flash 是其中速度最快且成本最低的选项。该测试涉及跨多个应用的长运行工作流,并通过要求完全成功的确定性检查进行评分。
Qwen3.8-Max(2.4T)是一款全新的开源权重模型,在所有基准测试类别中的表现与Kimi K3和DeepSeek V4 Flash非常接近,同时在编码和软件任务中展现出更优越的性能。
Qwen 3.8-Max 已发布,目前在 Vision Arena 排行榜上位列第 2,仅次于 Claude Fable 5 Max。
文章宣布,DeepSeek-V4-Flash-0731模型在象棋基准测试中超越了Fable-5、Sol和Kimi-K3。
Levent Bulut 发布了一项包含三项研究的基准测试,评估土耳其叙事语料库中机器生成标注的可靠性,揭示了自动评分器与人类判断之间的显著差异。该研究使用基于规则的检测器以及 Gemini 2.5 Flash、Grok、ChatGPT 5.5 和 Claude Fable 5 High 等模型,对 120 个和 100 个场景中的六个二元工艺特征进行了测试。
DeepSeek-V4-Flash-0731 模型达到了 50 的智能指数分数,这一指标与 2026 年 3 月顶级前沿模型的表现相匹配,当时的分数为 51。
Reddit上流传的一个翻译梗图表明,由于DeepSeek v4 flash带来的竞争压力,竞争对手不得不将价格降低80%。该开源模型拥有2840亿总参数和130亿活跃参数,提供了卓越的性价比指标。
DeepSeek 声称其新发布的通用模型 DeepSeek V4 Flash 在 DeepSWE 基准测试中达到了与 Anthropic's Sonnet 5 和 xAI's Grok 4.5 相同的性能水平。
DeepSeek-V4-Flash-0731模型在各种基准测试中显著优于DeepSeek-V4-Pro-Preview。
新的DeepSeek V4-Flash模型在ArtificialAnalysis指数中获得了50分的成绩。这一成绩使其仅比GLM-5.2和GPT-5.6 Luna低一分。
DeepSeek-V4-Flash-0731 模型在保持与前任相同定价的同时,性能优于 GLM 5.2。
DeepSeek 已更新其 V4 Flash 模型,于 2026-07-31 发布新版本,相比之前的预览版性能显著提升。此次更新引入了多个新基准测试的结果,并提升了现有基准的得分。
一位用户通过运行 34 个单样本提示并评估生成的 HTML、截图和 GIF,将 Kimi K3 与 Claude Opus 4.8 进行了对比评估。评估结论是 Kimi K3 产生的结果优于 Opus 4.8。