Google은 2,000개 이상의 음성 라이브러리를 갖춘 두 가지 새로운 텍스트-음성 변환 모델인 gemini-3.8-flash-tts와 gemini-3.8-flash-lite-tts를 출시했습니다.
API는 단 30초의 오디오 샘플만으로 커스텀 음성을 생성할 수 있으며, 사용자는 서로 다른 음성 스타일을 가진 다중 화자 대화를 정의할 수 있습니다.
테스트 결과, 1분 18초 분량의 오디오를 생성하는 데 약 20초가 소요되었으며, 표준 Flash 모델을 사용할 경우 비용은 2.74센트였습니다.