O Google lançou dois novos modelos de fala para fala, Gemini 3.8 Live e Gemini 3.8 Live Extended Thinking, que são semelhantes em estrutura aos modelos GPT-Live da OpenAI.

  • O lançamento inclui Gemini 3.8 Live e Gemini 3.8 Live Extended Thinking.
  • Uma interface web permite que os usuários selecionem um modelo e uma voz predefinida, insiram um prompt de sistema opcional e iniciem uma conversa por voz pelo navegador.
  • Os usuários podem interromper o modelo enquanto ele está falando, com as transcrições capturando essas interrupções.
  • A implementação conecta-se a um endpoint WebSocket e usa a Web Audio API para captura e reprodução sem bibliotecas externas.