xAI a publié un aperçu anticipé de Grok-2 et de sa variante plus légère, Grok-2 mini, marquant une amélioration significative par rapport au modèle précédent Grok-1.5. Ces nouveaux modèles sont actuellement disponibles en version bêta sur 𝕏 pour les utilisateurs Premium et Premium+, avec un accès API entreprise prévu pour la fin du mois.

  • Grok-2 démontre des capacités de pointe dans le chat, le codage et le raisonnement, surpassant Claude 3.5 Sonnet et GPT-4-Turbo sur le classement LMSYS Chatbot Arena.
  • Les deux modèles montrent des améliorations significatives par rapport à Grok-1.5 dans le respect des instructions, la fourniture d'informations factuelles et l'utilisation d'outils.
  • Les benchmarks indiquent des performances compétitives avec d'autres modèles de pointe en sciences de niveau supérieur (GPQA), connaissances générales (MMLU, MMLU-Pro) et mathématiques (MATH).
  • Grok-2 atteint des résultats de pointe dans le raisonnement mathématique visuel (MathVista) et la réponse aux questions basée sur des documents (DocVQA).
  • L'API entreprise prendra en charge des déploiements d'inférence multi-régions avec des fonctionnalités de sécurité renforcées comme l'authentification multifacteur obligatoire.

Cette publication place xAI à l'avant-garde du développement de l'IA en faisant progresser les capacités fondamentales de raisonnement grâce à un nouveau cluster informatique et à une compréhension multimodale élargie.