xAIのGrok 4モデルは、Arc-AGI2ベンチマークで15.9%のスコアを達成し、9.9%のスコアだったOpenAIのGPT5を上回りました。
- Grok 4はArc-AGI2ベンチマークでGPT5に対して大きなリードを持っています。
- xAIは2025年末までにGrok 5をリリースする計画です。
- Grok 5のトレーニングには、Nvidia H100約300万個またはB200チップ55万個に相当するコンピューティングリソースが使用されます。
xAIのGrok 4モデルは、Arc-AGI2ベンチマークで15.9%のスコアを達成し、9.9%のスコアだったOpenAIのGPT5を上回りました。
| ベンチマーク | モデル | スコア |
|---|---|---|
| ARC-AGI 2 | Grok 4 | 15.9% |
DeepSeekは、新しく一般公開されたモデル DeepSeek V4 Flash が、DeepSWE ベンチマークにおいて Anthropic's Sonnet 5 および xAI's Grok 4.5 と同等のパフォーマンスを達成したと主張しています。
OpenAIのGPT-5 Proは、FrontierMath Tier 4ベンチマークにおいて新しい記録を樹立し、GoogleのGemini 2.5 Deep Thinkと比較して1つ多い研究レベルの数学問題を解決した。この評価では、プロの数学者によって開発された50の極めて困難な問題に対して、3つの計算集約型モデル設定を手動で採点した。
OpenAIは、OpenAI APIで利用可能になった2つの新モデル、GPT-6 SolとGPT-6 Lunaをリリースした。これらのモデルは、以前にリリースされたGPT-6 Astraの下位に位置し、複雑なコーディングや大量の日常業務向けに、より高速で手頃なティアへ技術的進歩をもたらすことを目的としている。
Anthropicは、新しいClaude 5.5ファミリーの最初のモデルであるClaude Opus 5.5をリリースしました。これは以前の世代に対するより効率的な代替手段として位置づけられています。このモデルは、Opus 5の実行コストと比較して40%低く抑えながら、ほとんどのタスクにおいてClaude Fable 5.1のレベルでパフォーマンスを発揮するように設計されています。
英国AIセキュリティ研究所(AISI)は、ベンチマークの再現性を向上させるため、EvalEvalのEvaluation Cardsプラットフォームを通じて公に報告された評価手法と知見を公開しました。今回のリリースには、HealthBench、FrontierMath、Humanity's Last Exam、SWE-Bench Pro、Terminal-Bench 2.0という5つの特定のベンチマークに関する検証済み結果、文脈、および設定情報が含まれています。
アクセス解析とサイト改善のために Cookie を使用します。分析 Cookie を許可または拒否できます。 プライバシーポリシー