A xAI lançou o Grok Voice Transcribe 2.0, um modelo de fala para texto que é duas vezes mais preciso que a versão 1.0, mantendo o mesmo preço. Construído sobre o modelo base de áudio por trás do Grok Voice, ele utiliza um conjunto de dados exclusivo de áudio multilíngue ao vivo e ruidoso para lidar com condições desafiadoras do mundo real, como linhas telefônicas instáveis e vozes concorrentes.

  • Ocupa o primeiro lugar em precisão entre 32 modelos de streaming no ranking público do Artificial Analysis.
  • Melhora a taxa de erro de palavras em frases curtas de 20,6% para 6,8%, marcando sua maior melhoria multilíngue.
  • Lidera todos os modelos testados em áudio de telefonia e melhora o desempenho em quatro conjuntos de dados internos de produção.
  • Detecta automaticamente o idioma e lida com mudanças durante a gravação em uma única passagem para dezenas de idiomas.

A atualização logo se tornará o padrão na API de Fala para Texto, com a versão 1.0 programada para ser descontinuada nas próximas semanas.