xAIは、Grok-2とその小規模なバリエーションであるGrok-2 miniの早期プレビューをリリースし、以前のGrok-1.5モデルから大幅なアップグレードを示している。これらの新しいモデルは現在、PremiumおよびPremium+ユーザー向けに𝕏上でベータ版として利用可能であり、今月下旬にはエンタープライズAPIアクセスが計画されている。
- Grok-2は、チャット、コーディング、推論において最先端の能力を示し、LMSYS Chatbot ArenaリーダーボードでClaude 3.5 SonnetやGPT-4-Turboを上回るパフォーマンスを記録している。
- 両モデルとも、指示の遵守、事実情報の提供、ツール使用においてGrok-1.5と比較して大幅な改善を見せた。
- ベンチマークによると、大学院レベルの科学(GPQA)、一般知識(MMLU、MMLU-Pro)、数学(MATH)において他の最先端モデルと競争力のあるパフォーマンスを示している。
- Grok-2は、視覚的数学推論(MathVista)および文書ベースの質問応答(DocVQA)で最上位の結果を達成した。
- エンタープライズAPIは、必須の多要素認証などの強化されたセキュリティ機能とともに、マルチリージョン推論デプロイメントをサポートする。
今回のリリースにより、xAIは新しい計算クラスターと拡張されたマルチモーダル理解を通じて中核的な推論能力を前進させ、AI開発の最前線に位置づけられた。