Googleは、その技術が70億人以上のユーザーに対して300以上の言語をサポートするようになったと報告し、音声理解の向上、過小代表言語のデータ収集、アクセシビリティを改善するための新ツールを導入しました。

  • Gemini 3.5 Live Translateは、70言語および2,000以上のペア間でリアルタイムの音声翻訳を実現し、コードスイッチングや感情のニュアンスを捉えます。
  • 1,200万時間の音声データでトレーニングされたUniversal Speech Modelは、異言語間転移学習を活用し、世界で最も話されている1,000言語のカバレッジという目標をサポートします。
  • WAXAL、Project Vaani、Amplify Initiativeなどのオープンデータパートナーシップにより、サハラ以南のアフリカおよびインドの言語向けの広範な音声データが収集されました。
  • TranslateGemmaは、インターネット接続なしでデバイス上で効率的に実行できる軽量なオープン翻訳モデルを提供します。
  • Sign Language-to-Text (SL2T) は、アメリカ手話から始め、50以上の手話言語に対してGboardおよびLive Transcribeでの手話からテキストへのdictationを可能にします。

これらの革新は、言語技術のオフラインでのアクセス可能性、低資源方言のサポート、AIシステムにおける文化的ニュアンスの維持を通じて、デジタルデバイドを埋めることを目的としています。