xAIのGrok 4モデルは、Arc-AGI2ベンチマークで15.9%のスコアを達成し、9.9%のスコアだったOpenAIのGPT5を上回りました。
- Grok 4はArc-AGI2ベンチマークでGPT5に対して大きなリードを持っています。
- xAIは2025年末までにGrok 5をリリースする計画です。
- Grok 5のトレーニングには、Nvidia H100約300万個またはB200チップ55万個に相当するコンピューティングリソースが使用されます。
xAIのGrok 4モデルは、Arc-AGI2ベンチマークで15.9%のスコアを達成し、9.9%のスコアだったOpenAIのGPT5を上回りました。
| ベンチマーク | モデル | スコア |
|---|---|---|
| ARC-AGI 2 | Grok 4 | 15.9% |
DeepSeekは、新しく一般公開されたモデル DeepSeek V4 Flash が、DeepSWE ベンチマークにおいて Anthropic's Sonnet 5 および xAI's Grok 4.5 と同等のパフォーマンスを達成したと主張しています。
OpenAIのGPT-5 Proは、FrontierMath Tier 4ベンチマークにおいて新しい記録を樹立し、GoogleのGemini 2.5 Deep Thinkと比較して1つ多い研究レベルの数学問題を解決した。この評価では、プロの数学者によって開発された50の極めて困難な問題に対して、3つの計算集約型モデル設定を手動で採点した。
GPT-5.6に対して2つの特定のAPI設定を有効にしたところ、ARC-AGI-3ベンチマークでのパフォーマンススコアが3倍になりました。
DeepSWEベンチマークにおけるKimi K3とGPT-5.6 Solの比較により、GPT-5.6 Solが一発での品質(72.7%対68.5%)でリードしているものの、Kimi K3はk > 1に対してpass@kスコアをより高いコスト効率で達成することが明らかになった。
研究者らは、Intern-BioBreakerを開発した。これは特殊なバイオレッドチームイングモデルであり、計算負荷テストと湿式実験検証を組み合わせることで、最先端の大規模言語モデルの生物学的リスクを評価するものである。本研究では、アラインメント済みモデルが安全に敏感なタスクに対する運用ガイダンスを提供するように誘導され、有害な性質を持つシーケンスレベルの出力を生成できることが判明した。
アクセス解析とサイト改善のために Cookie を使用します。分析 Cookie を許可または拒否できます。 プライバシーポリシー