Googleは、インテリジェントな音声対話用に設計された音声からテキストへの変換モデル「Gemini 3.5 Transcribe」をリリースしました。これは、生音声を正確で洗練されたテキストに変換し、背景ノイズや発話の曖昧さを処理します。

  • Artificial Analysisによる測定で、ストリーミングの場合は平均単語誤り率(WER)4.0%、非ストリーミングの場合は2.6%を達成。
  • 以前のChirp 3モデルと比較して、最終的な文字起こしまでの時間を70%短縮。
  • 85以上の言語を自動検出でサポートし、専門用語向けのユーザー定義語彙も処理可能。
  • Live APIを通じてリアルタイムストリーミングを提供し、Interactions APIを通じて録音済み音声の処理をサポート。
  • 画像生成などのタスクを他のGeminiモデルに委譲するための関数呼び出しを有効化。

本モデルは、Gemini API、Google AI Studio、およびGemini Enterprise Agent Platformを通じてパブリックプレビューとして利用可能です。