2つのAPI設定によりGPT-5.6のARC-AGI-3スコアが3倍に
GPT-5.6に対して2つの特定のAPI設定を有効にしたところ、ARC-AGI-3ベンチマークでのパフォーマンススコアが3倍になりました。
GPT-5.6に対して2つの特定のAPI設定を有効にしたところ、ARC-AGI-3ベンチマークでのパフォーマンススコアが3倍になりました。
Z.aiは、ベースモデルGLM-5.2のポストトレーニングを拡張することで、エージェント型コーディングベンチマークで最先端のパフォーマンスを達成する新モデルGLM-5.3を発表しました。約750Bパラメータを持つこのモデルは、現在Kimi K3を上回り、Claude Fable 5およびGPT-5.6-Solと同等かそれ以上の性能を各種ベンチマークで示しています。
DeepSWEベンチマークにおけるDeepSeek-V4 Flash 0731とGPT-5.6 Lunaの比較により、GPT-5.6 Lunaがより強力なエンジニアである一方で、両モデルを用いたカスケード戦略は、より低いコストでより高い精度を達成することが明らかになった。
アリババは、新しいフラッグシップモデルとしてQwen3.8-Maxを発表し、これは長期のエージェントワーク、コーディング、マルチモーダル推論に焦点を当てた2.4Tパラメータのスパースアーキテクチャであると説明した。同社は、Qwen3.8-Maxのオープンウェイトが、オープンウェイト版のQwen3.8-27Bとともに来週公開されると確認した。
DeepSeekはV4 Flashモデルを更新し、2026-07-31にリリースされた新バージョンは、以前のプレビュー版と比較して大幅なパフォーマンス向上を示している。今回のアップデートでは、いくつかの新規ベンチマークの結果が導入され、既存のベンチマークでもスコアが改善された。
DeepSWEベンチマークにおけるKimi K3とGPT-5.6 Solの比較により、GPT-5.6 Solが一発での品質(72.7%対68.5%)でリードしているものの、Kimi K3はk > 1に対してpass@kスコアをより高いコスト効率で達成することが明らかになった。
Anthropicはコーディング能力や汎用能力の指標におけるそのパフォーマンスへの注目を集め、フロンティアモデルの評価に関する議論を再燃させる形でClaude Opus 5モデルをリリースした。
Anthropicは、ベンチマークスコアと実務パフォーマンスについて大きな議論を巻き起こした新しいフロンティアモデルであるClaude Opus 5をリリースしました。Epoch AIによる独立した評価では、新モデルのEpoch Capabilities Index (ECI) が159、SWE-ECIが161であると報告されています。
Moonshot AIが公開するオープンウェイトモデルであるKimi K3は、DeepSWEベンチマークにおいてAnthropicのClaude Fable 5と同等のパフォーマンスを発揮し、タスクあたりのコストを大幅に抑えています。2026年7月16日の評価では、Kimi K3はpass@1で68.5%を達成し、Fable 5の69.9%には及びませんでしたが、複数回の試行シナリオではこれを上回り、コスト効率においても優れていました。
Sierra Research は τ-bench 1.0.1 をリリースし、`banking_knowledge` タスクの採点スキームを修正して、慎重な検証読み取りに対してエージェントがペナルティを受けないようにし、いくつかのデータの不整合を修正しました。このアップデートにより、リーダーボードの再採点でスコアが増加するだけで、以前合格していたシミュレーションが不合格になることはありません。
7月16日、Moonshot AIは最新フラッグシップモデルであるKimi K3をリリースしました。これは2.8兆パラメータを持つMixture of Experts (MoE)アーキテクチャです。同社は7月27日にモデルの重みを公開すると約束しています。
Moonshotは、中国のモデルがフロンティアにどれほど近づいているかについて再評価を引き起こしたオープンウェイトモデル「Kimi K3」をリリースした。このリリースは、コーディング、エージェントタスク、長期の知識作業における強力なパフォーマンスによって特徴づけられる。
Moonshot AIは、2.8兆個のパラメータとネイティブなマルチモーダル入力機能を備えた新しいフロンティアクラスのオープンウェイトモデルであるKimi K3を発表しました。公式には「Open Frontier Intelligence」と位置づけられており、100万トークンのコンテキストウィンドウをサポートし、効率を向上させるためにKimi Delta Attention (KDA) やAttention Residualsといった新規のアーキテクチャコンポーネントを活用しています。
Moonshot AIは、2.8兆パラメータとネイティブなマルチモーダル入力を備えたフロンティアクラスのオープンウェイトモデル「Kimi K3」をリリースした。本モデルは、長いコンテキストでの高速なデコーディングを実現するKimi Delta Attention(KDA)を搭載し、長期のエージェント型コーディングワークフローに対応している。
中国のAIラボであるMoonshot AIは、Kimi K3を発表し、これをこれまでの最も高性能なモデルとして位置づけた。同モデルは2.8兆パラメータを備えている。現在、ウェブサイトおよびAPIを通じて利用可能であり、2026年7月27日までにオープンウェイト版の公開が約束されている。
DharmaOCRは、ドメイン固有のトレーニングを通じて、Mistral OCR4やUnlimited-OCRよりもブラジルポルトガル語における抽出品質と安定性で優れています。
QwenはQwen3.8-27Bモデルをリリースし、ModelScopeおよびHugging Faceでダウンロード可能です。
記事では、Gemini 3.7 Flash アップデートのチャートが強調されており、以前のバージョン(特に 3.5 および 3.6 Flash)が、Claude 4.8+ や GPT 5.5+ シリーズなどのより新しいモデルに遅れを取っていたことが示されています。
Reddit のユーザーが DeepSeek DSv4 Flash 0731 モデルを注目させ、そのコストに対する強力なパフォーマンス能力に言及しています。投稿では、モデルが非常に優れたパフォーマンスを示すという主張を支えるために Artificial Analysis Intelligence Index v4.1.1 が参照されています。
低所得・中所得環境向けに設計された、VITAという目的特化型の検索拡張生成システムが、HealthBenchベンチマークを用いて汎用大規模言語モデルと比較評価された。本研究は、コーパス固有の設計により、新しい最先端モデルがリリースされても競争力のある性能を維持できることを示している。