A Google introduziu o Gemini 3.8 Live e o Gemini 3.8 Live Extended Thinking, modelos nativos de fala-para-fala projetados para agentes de voz em tempo real que raciocinam e executam ferramentas sem interromper o fluxo da conversa.
- Ambos os modelos estão agora disponíveis na API Gemini Live e no Google AI Studio como soluções hospedadas.
- O Gemini 3.8 Live foca em escala e eficiência de custos, enquanto o Extended Thinking adiciona capacidades de raciocínio em múltiplos passos.
- O Extended Thinking ocupa a posição #1 no Índice de Qualidade de Fala para Fala da Artificial Analysis com uma pontuação de 82.6.
- Os modelos suportam chamada de função assíncrona, contexto visual, precisão alfanumérica e 97 idiomas.
- A precificação está definida em $0.005/min para entrada de áudio e $0.018/min para saída de áudio via API Live.
Estes lançamentos fornecem uma alternativa simplificada aos pipelines de fala em cascata, permitindo que desenvolvedores construam agentes de voz prontos para produção com uso integrado de ferramentas e baixa latência.