SpaceXAI가 호스팅 API를 통해 제공되는 음성-텍스트 모델인 Grok Voice Transcribe 2.0을 출시했으며, 이는 동일한 가격대에서 버전 1.0 대비 두 배의 정확도를 주장합니다. 이 모델은 시끄러운 전화 회선과 경쟁하는 음성 등 어려운 오디오 조건을 대상으로 하며, 배치 및 실시간 스트리밍 모드에서 실행됩니다.
- AA-WER Streaming 벤치마크를 사용하여 Artificial Analysis 리더보드에서 32개 스트리밍 모델 중 1위를 기록했습니다.
- 19개 언어의 짧은 구절에서 단어 오류율(Word Error Rate)이 20.6%에서 6.8%로 감소했으며, 이는 약 67% 적은 오류를 의미합니다.
- 수십 개 언어에 대한 자동 언어 감지 및 녹음 중 언어 전환을 지원합니다.
- 별도의 추가 비용 없이 화자 분리, 단어 단위 타임스탬프, 주요 용어 편향 적용, 불필요한 말버릇 제거 등의 기능을 포함합니다.
- 배치 변환은 시간당 $0.10, 스트리밍은 시간당 $0.20으로 가격 책정됩니다.
Atlassian Loom은 이전 솔루션보다 더 높은 정확도를 인용하며 워크플로우의 모든 비디오를 변환하기 위해 이 API를 채택했습니다.