В техническом отчете AuK представлена открытая базовая модель, объединяющая генерацию и редактирование речи с помощью инструкций на естественном языке и аудио-контекста.

  • Модель обучена на примерно 3,03 миллиарда пар «инструкция-аудио» и 1,95 миллиона часов размеченных данных по пяти семействам задач.
  • Архитектура объединяет мультимодальную большую языковую модель, VAE для акустического кондиционирования и гибридный трансформер на основе прямого потока (rectified-flow).
  • Постобучение включает оптимизацию предпочтений по отзывам людей и обучение с подкреплением на основе вознаграждения.
  • AuK-Flash обеспечивает вывод за 4 шага, что дает ускорение на 4,5 раза по реальному времени по сравнению с полной моделью.

Авторы публикуют исходный код и веса модели для обеспечения воспроизводимости и дальнейших исследований.