新しいDeepSeek V4-Flashモデルは、ArtificialAnalysis指数で50のスコアを達成しました。この結果により、GLM-5.2およびGPT-5.6 Lunaにわずか1ポイント及ばない位置にあります。
media
r/LocalLLaMA
·
46日前
·
open_models
DeepSeek V4-FlashがArtificialAnalysis指数で50を達成
翻訳元 English → 日本語
ベンチマーク
| ベンチマーク | モデル | スコア |
|---|---|---|
| Artificial Analysis Intelligence Index | DeepSeek V4-Flash | 50% |
関連記事
media
MarkTechPost
·
58日前
·
43 回表示
ベンチマーク、ライセンス、推論コストで比較されるKimi K3、DeepSeek V4 Pro、GLM-5.2
Moonshot AIのKimi K3、DeepSeek V4 Pro、Zhipu AIのGLM-5.2という3つのオープンウェイトなスパースMixture-of-Expertsモデルの比較は、長期のコーディングおよびエージェントワークロードにおけるその能力、ライセンス条項、推論コストを評価するものである。
media
r/LocalLLaMA
·
19時間前
·
3 回表示
Base-10のチャーリー・オニールはKimiとGLMがOpus 5より優れていると主張
Base-10のチャーリー・オニールは、Dwarkesh Patelとの最近のエピソードで、KimiとGLMモデルが「ほぼ客観的に」Opus 5よりも優れている理由について議論した。
media
r/LocalLLaMA
·
2日前
·
3 回表示
DeepSeek V4.1 Flash が Artificial Analysis Intelligence Index v4.3 で首位を獲得
DeepSeek V4.1 Flash は、Artificial Analysis Intelligence Index v4.3 のアップデートにおいて、新しい Astra ベンチマークで第1位となりました。
media
r/LocalLLaMA
·
5日前
·
4 回表示
LiveBenchにDeepSeek v4.1 Flashが追加
LiveBenchベンチマークプラットフォームは、評価スイートにDeepSeek v4.1 Flashモデルを追加しました。
media
Together AI Blog
·
18日前
·
27 回表示
GLM-5.3 Flashの蒸留は、コストを17分の1に削減する代わりに一貫性を犠牲にする
DeepSWEベンチマークにおけるGLM-5.3とその蒸留版であるGLM-5.3 Flashの比較により、蒸留がコアとなるコーディング能力を維持しつつロールアウトコストを大幅に削減できることが示された。フルモデルはタスクあたり$3.99でpass@1レート69.0%を達成する一方、Flashバリアントはわずか$0.24で63.4%を獲得し、価格が17分の1に低下したことを意味する。