A SpaceXAI lançou o Grok Voice Transcribe 2.0, um modelo de fala para texto disponível por meio de uma API hospedada que afirma ter o dobro da precisão da versão 1.0 no mesmo ponto de preço. O modelo é voltado para condições de áudio difíceis, como linhas telefônicas ruidosas e vozes concorrentes, operando nos modos em lote e streaming em tempo real.

  • Classificado em primeiro lugar entre 32 modelos de streaming no ranking da Artificial Analysis usando o benchmark AA-WER Streaming.
  • Conseguiu uma redução na taxa de erro de palavras de 20,6% para 6,8% em frases curtas em 19 idiomas, representando aproximadamente 67% menos erros.
  • Suporta detecção automática de idioma e troca de idioma durante a gravação para dezenas de idiomas.
  • Inclui recursos como diárioização de falantes, carimbos de tempo em nível de palavra, viés de termos-chave e remoção de palavras preenchidas sem custo adicional.
  • Preços de US$ 0,10 por hora para transcrição em lote e US$ 0,20 por hora para streaming.

A Atlassian Loom adotou a API para transcrever todos os vídeos em seu fluxo de trabalho, citando maior precisão do que sua solução anterior.