Google выпустила две новые модели преобразования речи в речь: Gemini 3.8 Live и Gemini 3.8 Live Extended Thinking, которые по структуре схожи с моделями GPT-Live от OpenAI.
- В релиз входят Gemini 3.8 Live и Gemini 3.8 Live Extended Thinking.
- Веб-интерфейс позволяет пользователям выбирать модель и предустановленный голос, вводить необязательный системный промпт и начинать голосовой разговор через браузер.
- Пользователи могут прерывать модель во время её речи, при этом транскрипция фиксирует эти прерывания.
- Реализация подключается к конечной точке WebSocket и использует Web Audio API для захвата и воспроизведения без внешних библиотек.