LiveBenchベンチマークプラットフォームは、評価スイートにDeepSeek v4.1 Flashモデルを追加しました。
- このモデルは、5.6 Solモデルと同等のパフォーマンスを発揮すると説明されています。
- 評価において、比較対象モデルの価格の10分の1未満で利用可能であることが注目されています。
LiveBenchベンチマークプラットフォームは、評価スイートにDeepSeek v4.1 Flashモデルを追加しました。
「Qwen3.8-Flash-Next は DeepSeek V4 Pro より優れている」というタイトルの Reddit 投稿が、ユーザー /u/Normal-Phone7762 によって r/LocalLLaMA コミュニティに投稿されました。
DeepSWEベンチマークにおけるDeepSeek V4 Pro 0813とClaude Fable 5の比較により、両方のモデルを使用するルーティング戦略は、各タスクあたり$8.28で82.7%のタスクを解決し、Fable単独(69.7%)を上回り、大幅に安価であることが示された。
DeepSWEベンチマークにおけるDeepSeek V4 Pro 0813とGPT-5.6 Solの比較により、テスト失敗時にGPT-5.6 Solにエスカレーションする形でDeepSeekを最初に実行することで、タスクあたり$3.35で83.0%のパス率を実現できることが示された。
Artificial Analysis は Qwen3.8-27B モデルのベンチマーク結果を公開し、そのパフォーマンスを DeepSeek V4 および GPT-5.6 Luna Max と直接比較しました。
Reddit のユーザーが DeepSeek DSv4 Flash 0731 モデルを注目させ、そのコストに対する強力なパフォーマンス能力に言及しています。投稿では、モデルが非常に優れたパフォーマンスを示すという主張を支えるために Artificial Analysis Intelligence Index v4.1.1 が参照されています。
アクセス解析とサイト改善のために Cookie を使用します。分析 Cookie を許可または拒否できます。 プライバシーポリシー