xAI ha lanzado una vista previa temprana de Grok-2 y su variante más pequeña, Grok-2 mini, marcando una mejora significativa respecto al modelo anterior Grok-1.5. Estos nuevos modelos están actualmente disponibles en beta en 𝕏 para usuarios Premium y Premium+, con acceso a la API empresarial planeado para finales de este mes.

  • Grok-2 demuestra capacidades de vanguardia en chat, codificación y razonamiento, superando a Claude 3.5 Sonnet y GPT-4-Turbo en el tablero de clasificación LMSYS Chatbot Arena.
  • Ambos modelos muestran mejoras significativas sobre Grok-1.5 en la ejecución de instrucciones, proporcionación de información factual y uso de herramientas.
  • Los benchmarks indican un rendimiento competitivo con otros modelos de vanguardia en ciencias a nivel de posgrado (GPQA), conocimiento general (MMLU, MMLU-Pro) y matemáticas (MATH).
  • Grok-2 alcanza resultados de estado del arte en razonamiento matemático visual (MathVista) y respuesta a preguntas basada en documentos (DocVQA).
  • La API empresarial admitirá implementaciones de inferencia multi-región con características de seguridad mejoradas como autenticación multifactor obligatoria.

El lanzamiento posiciona a xAI a la vanguardia del desarrollo de IA al avanzar las capacidades centrales de razonamiento mediante un nuevo clúster de cómputo y una comprensión multimodal ampliada.