SpaceXAIは、ホストされたAPIを通じて提供される音声からテキストへの変換モデル「Grok Voice Transcribe 2.0」をリリースしました。このモデルは、同じ価格帯でバージョン1.0の約2倍の精度を実現すると主張しています。本モデルは、ノイズの多い電話回線や競合する音声といった困難な音声環境を対象としており、バッチ処理とリアルタイムストリーミングの両方のモードで動作します。
- Artificial Analysisのリーダーボードにおいて、AA-WER Streamingベンチマークを用いて32つのストリーミングモデルの中で1位を獲得しました。
- 19言語における短いフレーズで単語誤り率(WER)が20.6%から6.8%に低下し、エラーが約67%減少しました。
- 数十の言語に対する自動言語検出と、録音中の言語切り替えをサポートしています。
- スピーカー diarization、単語レベルの時計マーク、重要用語のバイアス付け、フィラーワードの除去などの機能を追加料金なしで提供しています。
- バッチトランスクリプションは時間あたり0.10ドル、ストリーミングは時間あたり0.20ドルで価格設定されています。
Atlassian LoomはこのAPIを採用し、ワークフロー内のすべてのビデオをトランスクリプトするようになり、以前のソリューションよりも高い精度を実現したと述べています。