Googleは、その技術が70億人以上のユーザーに対して300以上の言語をサポートするようになったと報告し、音声理解の向上、過小代表言語のデータ収集、アクセシビリティを改善するための新ツールを導入しました。
- Gemini 3.5 Live Translateは、70言語および2,000以上のペア間でリアルタイムの音声翻訳を実現し、コードスイッチングや感情のニュアンスを捉えます。
- 1,200万時間の音声データでトレーニングされたUniversal Speech Modelは、異言語間転移学習を活用し、世界で最も話されている1,000言語のカバレッジという目標をサポートします。
- WAXAL、Project Vaani、Amplify Initiativeなどのオープンデータパートナーシップにより、サハラ以南のアフリカおよびインドの言語向けの広範な音声データが収集されました。
- TranslateGemmaは、インターネット接続なしでデバイス上で効率的に実行できる軽量なオープン翻訳モデルを提供します。
- Sign Language-to-Text (SL2T) は、アメリカ手話から始め、50以上の手話言語に対してGboardおよびLive Transcribeでの手話からテキストへのdictationを可能にします。
これらの革新は、言語技術のオフラインでのアクセス可能性、低資源方言のサポート、AIシステムにおける文化的ニュアンスの維持を通じて、デジタルデバイドを埋めることを目的としています。