DeepSeek 声称其新发布的通用模型 DeepSeek V4 Flash 在 DeepSWE 基准测试中达到了与 Anthropic's Sonnet 5 和 xAI's Grok 4.5 相同的性能水平。
- DeepSeek V4 Flash 现已全面开放使用。
- 该模型在 DeepSWE 上与 Sonnet 5 和 Grok 4.5 排名相同。
- 这些结果由 DeepSeek 声称,但尚未得到 DeepSWE 团队的验证。
此次公告突显了 DeepSeek 在代码基准测试中的竞争地位,尽管独立验证仍在进行中。