Tencent сделала свою базовую модель AuK 1.5B для генерации и редактирования речи доступной как программное обеспечение с открытым исходным кодом, включая код и веса модели.
- Поддерживает zero-shot и инструкционно-управляемое преобразование текста в речь, редактирование контента и акустики, паралингвистическое редактирование, улучшение речи и разделение источников через единый интерфейс на естественном языке.
- Включает AuK-Flash, 4-шаговую дистиллированную версию для более быстрого вывода.
- Использует модель Qwen2.5-Omni-3B в качестве кодировщика MLLM.
- Выпущена под лицензией MIT, веса доступны на Hugging Face и ModelScope.
Выпуск позволяет исследователям и разработчикам получать доступ к базовой модели и дистиллированным вариантам для различных задач обработки аудио.