この記事では、DeepSeek V4 Flash 0731 モデルの ARC-AGI ベンチマーク結果を紹介します。ARC Prize 組織がホストする公式結果ページへのリンクが含まれています。
ソーステキストには、追加の詳細、スコア、または特定の発見は提供されていません。
この記事では、DeepSeek V4 Flash 0731 モデルの ARC-AGI ベンチマーク結果を紹介します。ARC Prize 組織がホストする公式結果ページへのリンクが含まれています。
ソーステキストには、追加の詳細、スコア、または特定の発見は提供されていません。
DeepSeekは、より小型の「Flash」モデルの更新版であるDeepSeek-V4-Flash-0731をリリースしました。このモデルは、独立したベンチマークにおいてより大規模なDeepSeek-V4-Proを上回る性能を示しています。今回のリリースでは、元のMixture-of-Expertsアーキテクチャ(総パラメータ数2840億)を維持しつつ、新しいファインチューニングプロセスを採用しています。
DeepSWEベンチマークにおけるDeepSeek-V4 Flash 0731とGPT-5.6 Lunaの比較により、GPT-5.6 Lunaがより強力なエンジニアである一方で、両モデルを用いたカスケード戦略は、より低いコストでより高い精度を達成することが明らかになった。
本記事は、DeepSeek-V4-Flash-0731モデルがチェスのベンチマークでFable-5、Sol、Kimi-K3を上回ったと発表しています。
DeepSeek-V4-Flash-0731 モデルは、2026年3月のトップフロンティアモデルのスコア51と同等のインテリジェンス指数スコア50を達成しました。
Redditで circulating している翻訳されたミームは、DeepSeek v4 flashからの競争圧力により、競合他社が価格を80%引き下げなければならなかったことを示しています。このオープンウェイトモデルは、2840億の総パラメータと130億のアクティブパラメータを持ち、優れた価格対パフォーマンス指標を提供します。
アクセス解析とサイト改善のために Cookie を使用します。分析 Cookie を許可または拒否できます。 プライバシーポリシー