xAI发布了Grok-2及其较小变体Grok-2 mini的早期预览版,标志着对前代Grok-1.5模型的重大升级。这些新模型目前已在𝕏上面向Premium和Premium+用户以beta形式提供,企业API访问计划在本月晚些时候推出。

  • Grok-2在聊天、编码和推理方面展现出前沿能力,在LMSYS Chatbot Arena排行榜上超越了Claude 3.5 Sonnet和GPT-4-Turbo。
  • 与Grok-1.5相比,这两个模型在遵循指令、提供事实信息以及工具使用方面均有显著提升。
  • 基准测试表明,在研究生级科学(GPQA)、通用知识(MMLU、MMLU-Pro)和数学(MATH)方面,其性能与其他前沿模型具有竞争力。
  • Grok-2在视觉数学推理(MathVista)和基于文档的问答(DocVQA)方面取得了最先进结果。
  • 企业API将支持多区域推理部署,并具备增强的安全功能,如强制多因素认证。

此次发布通过推进核心推理能力(借助新的计算集群和扩展的多模态理解),使xAI处于AI开发的前沿。