Google DeepMind и Android представили SL2T, массово многоязычную модель перевода языка жестов в текст (SL2T), которая впервые приносит ИИ языка жестов в потребительские продукты. Технология обеспечивает диктовку текста по жестам в Gboard и Live Transcribe на Pixel 11, начиная с американского языка жестов (ASL) на английский.
- SL2T обучена на более чем 100 000 часов данных по более чем 50 языкам жестов, достигнув нулевого показателя BLEURT 70 на бенчмарках FLEURS-ASL.
- Модель переводит напрямую из координат ориентиров позы, отслеживаемых MediaPipe Holistic, минуя промежуточные глоссы, чтобы захватывать немануальные маркеры и пространственные конструкции.
- Конфиденциальность поддерживается отправкой на сервер только геометрических координат, что позволяет немедленно отбрасывать исходные видеоданные.
- Система решает практические проблемы удобства использования, такие как задержка потоковой передачи, предотвращение галлюцинаций и производительность для левшей или людей, использующих один жест.
Выпуск призван преодолеть разрыв в общении между глухими и слышащими сообществами, обеспечивая более быстрое и естественное взаимодействие на мобильных устройствах. Разработка велась при руководстве Консультативного комитета по ИИ для языка жестов (AISLAC), чтобы обеспечить ответственное развертывание и культурную чувствительность.