Benchmark results
media The Batch · 2日前 Code Arena (Elo) · 1577.0Elo · 1 回表示

DeepSeekがV4-Flash-0731をリリース、低コストでV4-Proを上回る性能

DeepSeekは、より小型の「Flash」モデルの更新版であるDeepSeek-V4-Flash-0731をリリースしました。このモデルは、独立したベンチマークにおいてより大規模なDeepSeek-V4-Proを上回る性能を示しています。今回のリリースでは、元のMixture-of-Expertsアーキテクチャ(総パラメータ数2840億)を維持しつつ、新しいファインチューニングプロセスを採用しています。

arxiv arXiv cs.AI · 3日前

SciCode-Verifiedがベンチマークの欠陥を修正し、モデルの本格的な科学コーディング能力を明らかにする

著者らは、SciCodeベンチマークでのスコアの頭打ちが、モデルの能力の限界ではなく評価ツールの重大な欠陥に起因することを特定した。ドメイン専門家の65件のテスト問題に対する監査により263件の欠陥が発見され、そのうち192件は再現不能な正解や過度に厳しい許容範囲などの問題により、正しい解答が誤って却下される原因となっていた。

media AI News (smol.ai) · 4日前 Terminal-Bench 2 · 67.4% · 8 回表示

アリババ、2.4TパラメータのQwen3.8-Maxを発表し、間もなくオープンウェイトを公開

アリババは、新しいフラッグシップモデルとしてQwen3.8-Maxを発表し、これは長期のエージェントワーク、コーディング、マルチモーダル推論に焦点を当てた2.4Tパラメータのスパースアーキテクチャであると説明した。同社は、Qwen3.8-Maxのオープンウェイトが、オープンウェイト版のQwen3.8-27Bとともに来週公開されると確認した。

media r/LocalLLaMA · 6日前 · 2 回表示

DeepSeek v4 flashはエージェントタスクにおける速度とコストでオープンウェイトモデルをリード

ハードなエージェントタスクにおけるオープンウェイトモデルの内部評価により、DeepSeek v4 flashが同種のモデルの中で最速かつ最安のコストパフォーマンスを示したことが判明した。このテストでは、複数のアプリケーションにわたる長時間実行されるワークフローが実施され、完全な成功を必要とする決定論的なチェックによって採点された。

media Hugging Face Forums · 7日前 · 8 回表示

Levent BulutがLLM注釈の信頼性を客観的投影でベンチマーク

Levent Bulutは、トルコの物語コーパスに対する機械生成注釈の信頼性を評価する3つの研究からなるベンチマークを公開し、自動採点者と人間の判断の間に大きな乖離があることを明らかにした。この研究では、Gemini 2.5 Flash、Grok、ChatGPT 5.5、Claude Fable 5 Highを含むルールベースの検出器とモデルを使用して、120シーンと100シーンの6つのバイナリ工芸特徴がテストされた。

media r/LocalLLaMA · 9日前 · 3 回表示

284B総パラメータ、13BアクティブパラメータのオープンウェイトDeepSeek v4 flashが価格引き下げを強制

Redditで circulating している翻訳されたミームは、DeepSeek v4 flashからの競争圧力により、競合他社が価格を80%引き下げなければならなかったことを示しています。このオープンウェイトモデルは、2840億の総パラメータと130億のアクティブパラメータを持ち、優れた価格対パフォーマンス指標を提供します。

media r/LocalLLaMA · 9日前 · 13 回表示

DeepSeek V4 FlashのTerminal BenchおよびToolathlonスコアが改善されたアップデート

DeepSeekはV4 Flashモデルを更新し、2026-07-31にリリースされた新バージョンは、以前のプレビュー版と比較して大幅なパフォーマンス向上を示している。今回のアップデートでは、いくつかの新規ベンチマークの結果が導入され、既存のベンチマークでもスコアが改善された。