xAIは、バージョン1.0の2倍の精度を持ちながら同じ価格を維持する音声からテキストへの変換モデルであるGrok Voice Transcribe 2.0をリリースしました。Grok Voiceの背後にあるオーディオ基盤モデルに基づいて構築され、不安定な電話回線や競合する音声など、困難な現実世界の条件に対応するために、ライブでノイズのある多言語オーディオの独自のデータセットを活用しています。

  • Artificial Analysisの公開リーダーボードで32のストリーミングモデルの中で精度が第1位です。
  • 短いフレーズの単語誤り率を20.6%から6.8%に改善し、最大の多言語改善を示しました。
  • 電話音声のテストされたすべてのモデルで首位であり、4つの内部生産データセット全体でパフォーマンスを向上させました。
  • 言語を自動的に検出し、数十の言語に対して録音中の切り替えを単一パスで処理します。

このアップデートはまもなくSpeech-to-Text APIのデフォルトとなり、バージョン1.0は数週以内に廃止予定となっています。