Google은 대화 흐름을 끊지 않고 추론하고 도구를 실행하는 실시간 음성 에이전트용으로 설계된 네이티브 스피치-투-스피치 모델인 Gemini 3.8 Live와 Gemini 3.8 Live Extended Thinking를 소개했습니다.
- 두 모델은 모두 호스팅 솔루션으로 Gemini Live API 및 Google AI Studio에서 이제 사용 가능합니다.
- Gemini 3.8 Live는 확장성과 비용 효율성에 중점을 두고 있으며, Extended Thinking는 다단계 추론 기능을 추가합니다.
- Extended Thinking는 Artificial Analysis의 Speech to Speech Quality Index에서 82.6점의 점수로 1위를 차지했습니다.
- 이 모델들은 비동기 함수 호출, 시각적 컨텍스트, 영숫자 정밀도 및 97개 언어를 지원합니다.
- Live API를 통한 오디오 입력 가격은 분당 $0.005, 오디오 출력 가격은 분당 $0.018로 책정되었습니다.
이러한 출시들은 캐스케이디드 스피치 파이프라인에 대한 간소화된 대안을 제공하여 개발자가 통합된 도구 사용과 낮은 지연 시간을 갖춘 프로덕션 등급 음성 에이전트를 구축할 수 있도록 합니다.