Google AI는 사전 녹음된 파일을 위한 Interactions API와 실시간 스트리밍을 위한 Live API라는 두 가지 별도 API 엔드포인트를 통해 제공되는 음성-텍스트 모델인 Gemini 3.5 Transcribe를 출시했습니다.
- Artificial Analysis 측정에 따르면, 이 모델은 비스트리밍 환경에서 평균 단어 오류율(WER)이 2.6%, 스트리밍 환경에서는 4.0%를 기록합니다.
- 이전 Chirp 3 모델과 비교해 최종 전사 완료까지의 시간이 70% 단축되었습니다.
- 문장 중간 코드 전환을 포함하여 85개 이상의 언어를 자동으로 감지합니다.
- Live API는 초단위 지연 시간을 제공하지만, Interactions API에서 사용할 수 있는 화자 분할(diarization) 및 단어 단위 타임스탬프 기능은 지원하지 않습니다.
- 스마트 모드는 불필요한 발화(디스플루언시)를 제거하지만, 타임스탬프나 화자 분할과 결합할 수는 없습니다.
엔드포인트를 분리함으로써 개발자는 실시간 인터페이스용 저지연 스트리밍 또는 사후 처리용 상세 전사 기능 중 선택할 수 있습니다.