구글은 이제 70억 명 이상의 사용자를 위해 300개 이상의 언어를 지원하는 기술을 발표하며, 음성 이해 개선, 소외된 언어의 데이터 수집 및 접근성 향상을 위한 새로운 도구를 소개했습니다.

  • 제미니 3.5 라이브 번역은 70개 언어와 2,000개 이상의 쌍에서 실시간 음성 번역을 지원하며 코드 전환과 감정 단서를 포착합니다.
  • 1200만 시간의 오디오로 학습된 유니버설 스피치 모델은 전 세계 1,000개 주요 화자 언어를 커버하는 목표를 지원하기 위해 교차언어 전이 학습을 사용합니다.
  • WAXAL, 프로젝트 바아니 및 앰플리파이 이니셔티브와 같은 오픈 데이터 파트너십은 사하라 이남 아프리카 및 인도 언어를 위한 광범위한 음성 데이터를 수집했습니다.
  • TranslateGemma는 인터넷 연결 없이 장치에서 효율적으로 실행되는 경량 오픈 번역 모델을 제공합니다.
  • 수화에서 텍스트로(SL2T)는 미국 수화를 시작으로 50개 이상의 수화 언어에 대해 Gboard와 라이브 트랜스크라이브에서 수화에서 텍스트로 입력을 지원합니다.

이러한 혁신은 언어 기술을 오프라인으로 접근 가능하게 하고, 저자원 방언을 지원하며, AI 시스템에서 문화적 뉘앙스를 보존함으로써 디지털 격차를 해소하는 것을 목표로 합니다.