Tencent는 코드와 모델 가중치를 포함하여 음성 생성 및 편집을 위한 AuK 1.5B 파운데이션 모델을 오픈소스 소프트웨어로 공개했습니다.
- 통합 자연어 인터페이스를 통해 제로샷 및 지시 기반 텍스트-음성 변환, 콘텐츠 및 음향 편집, 부언어적 편집, 음성 향상 및 소스 분리를 지원합니다.
- 더 빠른 추론을 위한 4단계 증류 변형인 AuK-Flash를 포함합니다.
- MLLM 인코더로 Qwen2.5-Omni-3B 모델을 사용합니다.
- MIT 라이선스에 따라 출시되었으며, 가중치는 Hugging Face와 ModelScope에서 사용할 수 있습니다.
이번 출시는 연구자와 개발자가 다양한 오디오 처리 작업을 위해 기본 모델과 증류 변형에 접근할 수 있도록 합니다.