Tencent сделала фундаментальную модель AuK для генерации и редактирования речи доступной в открытом исходном коде, включая код и веса на Hugging Face и ModelScope. В релиз входит AuK-Flash, дистиллированный вариант, предназначенный для быстрого вывода всего за 4 шага.
- AuK — это модель на 1.5B параметров, обученная на миллионах часов аудиоданных.
- Она поддерживает zero-shot TTS, редактирование контента и акустики, паралингвистическое редактирование, улучшение речи и разделение источников по инструкциям на естественном языке.
- Репозиторий предоставляет официальные веса как для базовой модели, так и для быстрого варианта AuK-Flash.
- Приведены примеры установки и использования для платформ Hugging Face и ModelScope.
Релиз позволяет разработчикам получить доступ к единому интерфейсу для множества задач речи по лицензии MIT.