トピック · Benchmark results
media Interconnects · 3時間前

Z.aiが拡張されたポストトレーニング付きGLM-5.3をリリース

Z.aiは、ベースモデルGLM-5.2のポストトレーニングを拡張することで、エージェント型コーディングベンチマークで最先端のパフォーマンスを達成する新モデルGLM-5.3を発表しました。約750Bパラメータを持つこのモデルは、現在Kimi K3を上回り、Claude Fable 5およびGPT-5.6-Solと同等かそれ以上の性能を各種ベンチマークで示しています。

media AI News (smol.ai) · 10日前 Terminal-Bench 2 · 67.4% · 21 回表示

アリババ、2.4TパラメータのQwen3.8-Maxを発表し、間もなくオープンウェイトを公開

アリババは、新しいフラッグシップモデルとしてQwen3.8-Maxを発表し、これは長期のエージェントワーク、コーディング、マルチモーダル推論に焦点を当てた2.4Tパラメータのスパースアーキテクチャであると説明した。同社は、Qwen3.8-Maxのオープンウェイトが、オープンウェイト版のQwen3.8-27Bとともに来週公開されると確認した。

media r/LocalLLaMA · 15日前 · 15 回表示

DeepSeek V4 FlashのTerminal BenchおよびToolathlonスコアが改善されたアップデート

DeepSeekはV4 Flashモデルを更新し、2026-07-31にリリースされた新バージョンは、以前のプレビュー版と比較して大幅なパフォーマンス向上を示している。今回のアップデートでは、いくつかの新規ベンチマークの結果が導入され、既存のベンチマークでもスコアが改善された。

media Together AI Blog · 21日前 · 8 回表示

Kimi K3はDeepSWEの品質においてClaude Fable 5と同等で、コストは3分の1

Moonshot AIが公開するオープンウェイトモデルであるKimi K3は、DeepSWEベンチマークにおいてAnthropicのClaude Fable 5と同等のパフォーマンスを発揮し、タスクあたりのコストを大幅に抑えています。2026年7月16日の評価では、Kimi K3はpass@1で68.5%を達成し、Fable 5の69.9%には及びませんでしたが、複数回の試行シナリオではこれを上回り、コスト効率においても優れていました。

arxiv τ²-bench (tau2-bench) · 23日前 · 3 回表示

τ-bench 1.0.1 が banking_knowledge の採点を修正し、慎重なエージェントの行動をペナルティから保護

Sierra Research は τ-bench 1.0.1 をリリースし、`banking_knowledge` タスクの採点スキームを修正して、慎重な検証読み取りに対してエージェントがペナルティを受けないようにし、いくつかのデータの不整合を修正しました。このアップデートにより、リーダーボードの再採点でスコアが増加するだけで、以前合格していたシミュレーションが不合格になることはありません。

media AI News (smol.ai) · 28日前 · 6 回表示

Moonshotがコーディングと効率性に優れた中国製オープンウェイトモデル「Kimi K3」をリリース

Moonshotは、中国のモデルがフロンティアにどれほど近づいているかについて再評価を引き起こしたオープンウェイトモデル「Kimi K3」をリリースした。このリリースは、コーディング、エージェントタスク、長期の知識作業における強力なパフォーマンスによって特徴づけられる。

media Latent Space · 29日前 · 3 回表示

Moonshot AIが2.8Tパラメータのオープンフロンティアモデル「Kimi K3」をリリース

Moonshot AIは、2.8兆個のパラメータとネイティブなマルチモーダル入力機能を備えた新しいフロンティアクラスのオープンウェイトモデルであるKimi K3を発表しました。公式には「Open Frontier Intelligence」と位置づけられており、100万トークンのコンテキストウィンドウをサポートし、効率を向上させるためにKimi Delta Attention (KDA) やAttention Residualsといった新規のアーキテクチャコンポーネントを活用しています。

media AI News (smol.ai) · 29日前 · 4 回表示

Moonshotが2.8Tパラメータのオープンウェイトモデル「Kimi K3」をリリース

Moonshot AIは、2.8兆パラメータとネイティブなマルチモーダル入力を備えたフロンティアクラスのオープンウェイトモデル「Kimi K3」をリリースした。本モデルは、長いコンテキストでの高速なデコーディングを実現するKimi Delta Attention(KDA)を搭載し、長期のエージェント型コーディングワークフローに対応している。

blog Simon Willison · 29日前 · 12 回表示

Moonshot AIが2.8Tパラメータの高性能モデル「Kimi K3」を発表、高額な価格設定

中国のAIラボであるMoonshot AIは、Kimi K3を発表し、これをこれまでの最も高性能なモデルとして位置づけた。同モデルは2.8兆パラメータを備えている。現在、ウェブサイトおよびAPIを通じて利用可能であり、2026年7月27日までにオープンウェイト版の公開が約束されている。

arxiv arXiv cs.AI · 2日前 HealthBench · 51.9% · 4 回表示

VITAの臨床用RAGはHealthBenchにおいて最先端LLMと同等かそれ以上の性能を示す

低所得・中所得環境向けに設計された、VITAという目的特化型の検索拡張生成システムが、HealthBenchベンチマークを用いて汎用大規模言語モデルと比較評価された。本研究は、コーパス固有の設計により、新しい最先端モデルがリリースされても競争力のある性能を維持できることを示している。