O Google AI lançou o Gemini 3.5 Transcribe, um modelo de fala para texto disponível por meio de dois pontos de extremidade de API distintos: a Interactions API para arquivos pré-gravados e a Live API para streaming em tempo real.

  • O modelo relata uma taxa média de erro de palavras (WER) de 2,6% para não-streaming e 4,0% para streaming, conforme medido pelo Artificial Analysis.
  • O tempo até a transcrição final melhora em 70% em comparação ao modelo anterior Chirp 3.
  • A detecção automática suporta mais de 85 idiomas, incluindo alternância de código no meio da frase.
  • A Live API oferece latência inferior a um segundo, mas não possui diarização de locutores nem carimbos de tempo em nível de palavra, que estão disponíveis na Interactions API.
  • O modo inteligente remove disfluências, mas não pode ser combinado com carimbos de tempo ou diarização.

A divisão entre os pontos de extremidade permite que os desenvolvedores escolham entre streaming de baixa latência para interfaces ao vivo ou recursos detalhados de transcrição para pós-processamento.