Google은 OpenAI의 GPT-Live 모델과 형태가 유사한 두 가지 새로운 음성-to-음성 모델인 Gemini 3.8 Live와 Gemini 3.8 Live Extended Thinking을 출시했습니다.
- 이번 릴리스에는 Gemini 3.8 Live와 Gemini 3.8 Live Extended Thinking이 포함됩니다.
- 웹 UI를 통해 사용자는 모델을 선택하고 음성 프리셋을 지정하며, 선택적 시스템 프롬프트를 입력하고 브라우저를 통해 음성 대화를 시작할 수 있습니다.
- 사용자가 모델이 말하는 동안에 이를 중단할 수 있으며, 텍스트 변환은 이러한 중단 사항을 캡처합니다.
- 구현은 WebSocket 엔드포인트에 연결하고 외부 라이브러리 없이 Web Audio API를 사용하여 캡처 및 재생을 수행합니다.