xAI ha lanzado una vista previa temprana de Grok-2 y su variante más pequeña, Grok-2 mini, marcando una mejora significativa respecto al modelo anterior Grok-1.5. Estos nuevos modelos están actualmente disponibles en beta en 𝕏 para usuarios Premium y Premium+, con acceso a la API empresarial planeado para finales de este mes.
- Grok-2 demuestra capacidades de vanguardia en chat, codificación y razonamiento, superando a Claude 3.5 Sonnet y GPT-4-Turbo en el tablero de clasificación LMSYS Chatbot Arena.
- Ambos modelos muestran mejoras significativas sobre Grok-1.5 en la ejecución de instrucciones, proporcionación de información factual y uso de herramientas.
- Los benchmarks indican un rendimiento competitivo con otros modelos de vanguardia en ciencias a nivel de posgrado (GPQA), conocimiento general (MMLU, MMLU-Pro) y matemáticas (MATH).
- Grok-2 alcanza resultados de estado del arte en razonamiento matemático visual (MathVista) y respuesta a preguntas basada en documentos (DocVQA).
- La API empresarial admitirá implementaciones de inferencia multi-región con características de seguridad mejoradas como autenticación multifactor obligatoria.
El lanzamiento posiciona a xAI a la vanguardia del desarrollo de IA al avanzar las capacidades centrales de razonamiento mediante un nuevo clúster de cómputo y una comprensión multimodal ampliada.