xAIは、Chatbot Arenaのリーダーボードでスコア1402を獲得し、第1位を獲得した新しい大規模言語モデルであるGrok-3をリリースしました。この成果は、プラットフォーム上で任意のモデルが1400の閾値を突破したのは初めてであることを示しています。

  • Grok-3は、エロン・マスクによって前作のGrok-2よりも能力が桁違いに向上していると説明されています。
  • このモデルは、わずか122日間で展開された完全に接続されたH100 GPUクラスターを搭載したカスタム構築のAIスーパーコンピュータでトレーニングされました。
  • xAIは、適応型推論能力を強化するためにGrok-3 Reasoning Betaとより小型のGrok-3 Mini Reasoningモデルを導入しました。
  • 初期テストでは、大型のGrok-3モデルが高校生向けベンチマークであるAIME 2025においてミニ版を上回るパフォーマンスを示しています。
  • このリリースは、TetrisとBejeweledのミックスを生成することでデモンストレーションされたxAIのAIゲームスタジオの発表と同時期に行われました。

この急速な進歩は、モデルアーキテクチャとトレーニング効率における画期的な進展によるものであり、Grok-3をOpenAIやGoogle DeepMindのモデルに対する重要な競合他社として位置づけています。