O Google lançou o Gemini 3.5 Transcribe, um modelo de fala para texto projetado para interações de voz inteligentes que converte áudio bruto em texto preciso e polido, lidando com ruído de fundo e disfluências.
- Alcança uma Taxa Média de Erro de Palavra (WER) de 4,0% para streaming e 2,6% para casos de uso não em streaming conforme medido pela Artificial Analysis.
- Melhora o tempo até a transcrição final em 70% em comparação com o modelo anterior Chirp 3.
- Suporta mais de 85 idiomas com detecção automática e lida com vocabulário personalizado para jargão especializado.
- Oferece streaming em tempo real via Live API e processamento de áudio pré-gravado via Interactions API.
- Permite chamada de funções para delegar tarefas como geração de imagens a outros modelos Gemini.
O modelo está disponível em visualização pública através do Gemini API, Google AI Studio e da plataforma Gemini Enterprise Agent Platform.