구글은 지능형 음성 상호작용을 위해 설계된 음성-텍스트 모델인 Gemini 3.5 Transcribe를 출시했으며, 이는 배경 소음과 비유창성을 처리하면서 원본 오디오를 정확하고 다듬어진 텍스트로 변환합니다.

  • Artificial Analysis 측정에 따르면 스트리밍의 경우 평균 단어 오류율(WER)이 4.0%, 비스트리밍 사용 사례의 경우 2.6%를 달성합니다.
  • 이전 Chirp 3 모델과 비교하여 최종 녹취본까지의 시간을 70% 개선했습니다.
  • 자동 감지와 함께 85개 이상의 언어를 지원하며 전문 용어를 위한 사용자 정의 어휘를 처리합니다.
  • Live API를 통해 실시간 스트리밍을 제공하고 Interactions API를 통해 사전 녹음된 오디오 처리를 제공합니다.
  • 이미지 생성과 같은 작업을 다른 Gemini 모델에 위임하기 위해 함수 호출을 지원합니다.

이 모델은 Gemini API, Google AI Studio 및 Gemini Enterprise Agent Platform을 통해 공개 미리보기로 사용할 수 있습니다.