Google DeepMindとAndroidは、消費者向け製品に初めて手話AIをもたらす大規模多言語の手話からテキストへの変換(SL2T)モデルであるSL2Tを発表した。この技術は、Pixel 11におけるGboardおよびLive Transcribeでの手話からテキストへの入力支援を駆動し、まずはアメリカ手話(ASL)から英語へと対応する。
- SL2Tは50以上の手話言語にわたる10万時間以上のデータで学習され、FLEURS-ASLベンチマークにおいてゼロショットスコア70 BLEURTを達成した。
- モデルはMediaPipe Holisticによって追跡される姿勢ランドマーク座標から直接翻訳を行い、中間のグロスを省略することで非手話的マーカーや空間的な構成を捉える。
- プライバシー保護のため、サーバーへ幾何座標のみを送信し、元の動画データを直ちに破棄可能とする。
- システムはストリーミング遅延、幻覚(ハルシネーション)の防止、左利きまたは片手での手話使用者に対するパフォーマンスといった実用的な使いやすさの問題に対処している。
今回の公開は、モバイルデバイス上でより迅速で自然な対話を可能にすることで、聴覚障害者と健聴者の間のコミュニケーションギャップを埋めることを目的としている。開発はAI Sign Language Advisory Committee (AISLAC)の指導のもと、責任ある展開と文化的感受性を確保しながら行われた。