Tencent는 음성 생성 및 편집을 위한 AuK 파운데이션 모델을 Hugging Face와 ModelScope에서 코드와 가중치와 함께 오픈소스로 공개했습니다. 이번 릴리스에는 단 4단계로 빠른 추론이 가능한 압축 변형인 AuK-Flash가 포함되어 있습니다.

  • AuK는 수백만 시간의 오디오 데이터로 훈련된 1.5B 모델입니다.
  • 자연어 지침을 통해 제로샷 TTS, 콘텐츠 및 음향 편집, 부언어적 편집, 음성 향상 및 소스 분리를 지원합니다.
  • 저장소에는 기본 모델과 빠른 AuK-Flash 변형 모두에 대한 공식 가중치가 제공됩니다.
  • Hugging Face 및 ModelScope 플랫폼을 위한 설치 및 사용 예시가 제공됩니다.

이번 릴리스를 통해 개발자는 MIT 라이선스 하에 여러 음성 작업에 대한 통합 인터페이스에 접근할 수 있습니다.