Google AIは、2つの異なるAPIエンドポイントを通じて利用可能な音声からテキストへの変換モデルであるGemini 3.5 Transcribeをリリースしました。1つは録音済みファイル用のInteractions API、もう1つはリアルタイムストリーミング用のLive APIです。
- Artificial Analysisによる測定では、非ストリーミングの平均単語誤り率(WER)が2.6%、ストリーミングが4.0%と報告されています。
- 最終的な文字起こしまでの時間が、以前のChirp 3モデルと比較して70%短縮されました。
- 自動検出は、文中でのコードスイッチングを含む85以上の言語をサポートしています。
- Live APIは1秒未満のレイテンシを提供しますが、話者 diarization や単語レベルの時計マークは提供せず、これらはInteractions APIで利用可能です。
- スマートモードは不自然な発話を除去しますが、時計マークや diarization と組み合わせることはできません。
エンドポイントの分離により、開発者はライブインターフェース用の低レイテンシストリーミングか、後処理用の詳細な文字起こし機能のどちらかを選択できます。