Tencent сделала свою базовую модель AuK 1.5B для генерации и редактирования речи доступной как программное обеспечение с открытым исходным кодом, включая код и веса модели.

  • Поддерживает zero-shot и инструкционно-управляемое преобразование текста в речь, редактирование контента и акустики, паралингвистическое редактирование, улучшение речи и разделение источников через единый интерфейс на естественном языке.
  • Включает AuK-Flash, 4-шаговую дистиллированную версию для более быстрого вывода.
  • Использует модель Qwen2.5-Omni-3B в качестве кодировщика MLLM.
  • Выпущена под лицензией MIT, веса доступны на Hugging Face и ModelScope.

Выпуск позволяет исследователям и разработчикам получать доступ к базовой модели и дистиллированным вариантам для различных задач обработки аудио.