파리에 기반을 둔 음성 AI 기업 Gradium은 참조 오디오 없이 서술적 설명만으로 새로운 합성 음성을 생성하는 기능인 Voice Design을 출시했습니다. 이 도구는 현재 5개 언어를 지원하는 Gradium API 및 Studio에서 사용 가능합니다.
- 사용자는 성별, 연령, 억양, 피치 등의 속성을 상세히 기술한 1~500자 길이의 설명을 입력하면 3~5초 만에 최대 5개의 음성 후보를 받을 수 있습니다.
- 후보 음성은 네 단계의 REST 호출 흐름을 통해 생성되며, 선택된 음성은 클론과 공유되는 하나의 슬롯을 사용해 영구 커스텀 음성 슬롯으로 승격시킬 수 있습니다.
- 7,627건의 비교를 포함한 무작위 쌍대 청취 테스트에서 Gradium은 ElevenLabs 및 Inworld와 같은 경쟁사 대비 72.6%의 승리율을 기록했습니다.
- 이 시스템은 비결정적이어서 동일한 프롬프트가 매번 다른 결과를 생성하며, 저장되지 않은 후보는 30일 후 만료됩니다.
이로써 개발자는 실제 화자의 권리나 동의 없이도 필요에 따라 특정 음성 페르소나를 생성할 수 있습니다.