Google выпустила две новые модели преобразования речи в речь: Gemini 3.8 Live и Gemini 3.8 Live Extended Thinking, которые по структуре схожи с моделями GPT-Live от OpenAI.

  • В релиз входят Gemini 3.8 Live и Gemini 3.8 Live Extended Thinking.
  • Веб-интерфейс позволяет пользователям выбирать модель и предустановленный голос, вводить необязательный системный промпт и начинать голосовой разговор через браузер.
  • Пользователи могут прерывать модель во время её речи, при этом транскрипция фиксирует эти прерывания.
  • Реализация подключается к конечной точке WebSocket и использует Web Audio API для захвата и воспроизведения без внешних библиотек.