AuK 기술 보고서는 자연어 지시와 오디오 컨텍스트를 통해 음성 생성과 편집을 통합하는 오픈소스 기반 모델을 소개합니다.

  • 이 모델은 5가지 작업 패밀리에서 약 30억 3천만 개의 지시-오디오 인스턴스와 195만 시간의 감독 데이터로 학습되었습니다.
  • 아키텍처는 멀티모달 대규모 언어 모델, 음향 조건화를 위한 VAE, 그리고 하이브리드 직류 흐름 Transformer를 결합합니다.
  • 사후 훈련에는 인간 피드백 선호도 최적화와 보상 기반 강화 학습이 포함됩니다.
  • AuK-Flash는 전체 모델 대비 4.5배의 실제 시간 속도 향상을 제공하며 4단계 추론을 달성합니다.

저자들은 재현성과 추가 연구를 지원하기 위해 소스 코드와 모델 가중치를 공개했습니다.