← 戻る media r/LocalLLaMA · 2時間前 · open_models DeepSeek-V4-Flash-0731 が同じコストで GLM 5.2 を上回る 翻訳元 English → 日本語 DeepSeek-V4-Flash-0731 モデルは、前任と同じ価格を維持しながら GLM 5.2 よりも優れたパフォーマンスを発揮します。 このモデルは GLM 5.2 と比較して superior なパフォーマンスを達成しています。前バージョンと同じコスト構造を保持しています。 重要度 2/3 r/LocalLLaMA DeepSeek Benchmark results 原文を読む 関連記事 media r/LocalLLaMA · たった今 ライブ DeepSeek-V4-Flash-0731がベンチマークでDeepSeek-V4-Pro-Previewを上回る DeepSeek-V4-Flash-0731モデルは、さまざまなベンチマークテストでDeepSeek-V4-Pro-Previewを大幅に上回るパフォーマンスを示しています。 media r/LocalLLaMA · 1時間前 ライブ DeepSeek V4-FlashがArtificialAnalysis指数で50を達成 新しいDeepSeek V4-Flashモデルは、ArtificialAnalysis指数で50のスコアを達成しました。この結果により、GLM-5.2およびGPT-5.6 Lunaにわずか1ポイント及ばない位置にあります。 media r/LocalLLaMA · 2時間前 DeepSeek V4 FlashのTerminal BenchおよびToolathlonスコアが改善されたアップデート DeepSeekはV4 Flashモデルを更新し、2026-07-31にリリースされた新バージョンは、以前のプレビュー版と比較して大幅なパフォーマンス向上を示している。今回のアップデートでは、いくつかの新規ベンチマークの結果が導入され、既存のベンチマークでもスコアが改善された。 media MarkTechPost · 12日前 · 9 回表示 ベンチマーク、ライセンス、推論コストで比較されるKimi K3、DeepSeek V4 Pro、GLM-5.2 Moonshot AIのKimi K3、DeepSeek V4 Pro、Zhipu AIのGLM-5.2という3つのオープンウェイトなスパースMixture-of-Expertsモデルの比較は、長期のコーディングおよびエージェントワークロードにおけるその能力、ライセンス条項、推論コストを評価するものである。 media r/LocalLLaMA · 16日前 DeepSeek V4がワンショットコーディングで『ノーマンズスカイ』と『マインクラフト』のハイブリッドを生成 A/Bテストを通じて新しいバージョンのDeepSeek V4にアクセスしたユーザーが、ワンショットプログラミングのみを使用して、『ノーマンズスカイ』と『マインクラフト』の要素を組み合わせたハイブリッドゲームを作成しました。 生成されたソースコードとチャットログは公開されており、この特定の文脈におけるモデルの能力を示しています。 このデモンストレーションは、ワンショットプログラミングがベンチマーク目的には無意味だという主張に対する反証となります。
media r/LocalLLaMA · たった今 ライブ DeepSeek-V4-Flash-0731がベンチマークでDeepSeek-V4-Pro-Previewを上回る DeepSeek-V4-Flash-0731モデルは、さまざまなベンチマークテストでDeepSeek-V4-Pro-Previewを大幅に上回るパフォーマンスを示しています。
media r/LocalLLaMA · 1時間前 ライブ DeepSeek V4-FlashがArtificialAnalysis指数で50を達成 新しいDeepSeek V4-Flashモデルは、ArtificialAnalysis指数で50のスコアを達成しました。この結果により、GLM-5.2およびGPT-5.6 Lunaにわずか1ポイント及ばない位置にあります。
media r/LocalLLaMA · 2時間前 DeepSeek V4 FlashのTerminal BenchおよびToolathlonスコアが改善されたアップデート DeepSeekはV4 Flashモデルを更新し、2026-07-31にリリースされた新バージョンは、以前のプレビュー版と比較して大幅なパフォーマンス向上を示している。今回のアップデートでは、いくつかの新規ベンチマークの結果が導入され、既存のベンチマークでもスコアが改善された。
media MarkTechPost · 12日前 · 9 回表示 ベンチマーク、ライセンス、推論コストで比較されるKimi K3、DeepSeek V4 Pro、GLM-5.2 Moonshot AIのKimi K3、DeepSeek V4 Pro、Zhipu AIのGLM-5.2という3つのオープンウェイトなスパースMixture-of-Expertsモデルの比較は、長期のコーディングおよびエージェントワークロードにおけるその能力、ライセンス条項、推論コストを評価するものである。
media r/LocalLLaMA · 16日前 DeepSeek V4がワンショットコーディングで『ノーマンズスカイ』と『マインクラフト』のハイブリッドを生成 A/Bテストを通じて新しいバージョンのDeepSeek V4にアクセスしたユーザーが、ワンショットプログラミングのみを使用して、『ノーマンズスカイ』と『マインクラフト』の要素を組み合わせたハイブリッドゲームを作成しました。 生成されたソースコードとチャットログは公開されており、この特定の文脈におけるモデルの能力を示しています。 このデモンストレーションは、ワンショットプログラミングがベンチマーク目的には無意味だという主張に対する反証となります。