DeepSeek V4 Flash 0731 の ARC-AGI 結果
この記事では、DeepSeek V4 Flash 0731 モデルの ARC-AGI ベンチマーク結果を紹介します。ARC Prize 組織がホストする公式結果ページへのリンクが含まれています。
この記事では、DeepSeek V4 Flash 0731 モデルの ARC-AGI ベンチマーク結果を紹介します。ARC Prize 組織がホストする公式結果ページへのリンクが含まれています。
DeepSeekは、より小型の「Flash」モデルの更新版であるDeepSeek-V4-Flash-0731をリリースしました。このモデルは、独立したベンチマークにおいてより大規模なDeepSeek-V4-Proを上回る性能を示しています。今回のリリースでは、元のMixture-of-Expertsアーキテクチャ(総パラメータ数2840億)を維持しつつ、新しいファインチューニングプロセスを採用しています。
DeepSWEベンチマークにおけるDeepSeek-V4 Flash 0731とGPT-5.6 Lunaの比較により、GPT-5.6 Lunaがより強力なエンジニアである一方で、両モデルを用いたカスケード戦略は、より低いコストでより高い精度を達成することが明らかになった。
Artificial Analysisはエージェントインデックスを更新し、Qwen 3.8 Maxを総合ベストモデルとしてランク付けし、Opus 5よりも上位に配置しました。
著者らは、SciCodeベンチマークでのスコアの頭打ちが、モデルの能力の限界ではなく評価ツールの重大な欠陥に起因することを特定した。ドメイン専門家の65件のテスト問題に対する監査により263件の欠陥が発見され、そのうち192件は再現不能な正解や過度に厳しい許容範囲などの問題により、正しい解答が誤って却下される原因となっていた。
アリババは、新しいフラッグシップモデルとしてQwen3.8-Maxを発表し、これは長期のエージェントワーク、コーディング、マルチモーダル推論に焦点を当てた2.4Tパラメータのスパースアーキテクチャであると説明した。同社は、Qwen3.8-Maxのオープンウェイトが、オープンウェイト版のQwen3.8-27Bとともに来週公開されると確認した。
Qwen 3.8 MaxはDebate Benchmarkで1588点を達成し、Qwen 3.7 Maxの1462点を上回るスコアを記録しました。このベンチマークは、大規模言語モデルが様々なトピックにおいて敵対的な多ターン反対にさらされても論理を展開できる能力を評価します。
ハードなエージェントタスクにおけるオープンウェイトモデルの内部評価により、DeepSeek v4 flashが同種のモデルの中で最速かつ最安のコストパフォーマンスを示したことが判明した。このテストでは、複数のアプリケーションにわたる長時間実行されるワークフローが実施され、完全な成功を必要とする決定論的なチェックによって採点された。
Qwen3.8-Max (2.4T) は、すべてのベンチマークカテゴリにおいてKimi K3やDeepSeek V4 Flashに匹敵するパフォーマンスを示す新しいオープンウェイトモデルであり、コーディングおよびソフトウェアタスクではより優れたパフォーマンスを示しています。
Qwen 3.8-Max がリリースされ、現在 Claude Fable 5 Max に次いで Vision Arena リーダーボードで #2 の位置を占めています。
本記事は、DeepSeek-V4-Flash-0731モデルがチェスのベンチマークでFable-5、Sol、Kimi-K3を上回ったと発表しています。
Levent Bulutは、トルコの物語コーパスに対する機械生成注釈の信頼性を評価する3つの研究からなるベンチマークを公開し、自動採点者と人間の判断の間に大きな乖離があることを明らかにした。この研究では、Gemini 2.5 Flash、Grok、ChatGPT 5.5、Claude Fable 5 Highを含むルールベースの検出器とモデルを使用して、120シーンと100シーンの6つのバイナリ工芸特徴がテストされた。
DeepSeek-V4-Flash-0731 モデルは、2026年3月のトップフロンティアモデルのスコア51と同等のインテリジェンス指数スコア50を達成しました。
Redditで circulating している翻訳されたミームは、DeepSeek v4 flashからの競争圧力により、競合他社が価格を80%引き下げなければならなかったことを示しています。このオープンウェイトモデルは、2840億の総パラメータと130億のアクティブパラメータを持ち、優れた価格対パフォーマンス指標を提供します。
DeepSeekは、新しく一般公開されたモデル DeepSeek V4 Flash が、DeepSWE ベンチマークにおいて Anthropic's Sonnet 5 および xAI's Grok 4.5 と同等のパフォーマンスを達成したと主張しています。
DeepSeek-V4-Flash-0731モデルは、さまざまなベンチマークテストでDeepSeek-V4-Pro-Previewを大幅に上回るパフォーマンスを示しています。
新しいDeepSeek V4-Flashモデルは、ArtificialAnalysis指数で50のスコアを達成しました。この結果により、GLM-5.2およびGPT-5.6 Lunaにわずか1ポイント及ばない位置にあります。
DeepSeek-V4-Flash-0731 モデルは、前任と同じ価格を維持しながら GLM 5.2 よりも優れたパフォーマンスを発揮します。
DeepSeekはV4 Flashモデルを更新し、2026-07-31にリリースされた新バージョンは、以前のプレビュー版と比較して大幅なパフォーマンス向上を示している。今回のアップデートでは、いくつかの新規ベンチマークの結果が導入され、既存のベンチマークでもスコアが改善された。
あるユーザーは、Sonnet 4.6 を使用して 34 のワンショットプロンプトを実行し、その結果得られた HTML、スクリーンショット、GIF を評価することで、Claude Opus 4.8 に対して Kimi K3 を評価しました。その評価により、Kimi K3 が Opus 4.8 よりも優れた結果を生み出したことが結論付けられました。