xAIは、知能、文字起こし精度、会話能力を強化するために設計された次世代の音声から音声への音声モデルであるGrok Voice Think Fast 2.0を発表した。このアップデートは、前作に基盤を置き、音声推論、会話能力、ツール使用の信頼性において意味のある向上をもたらす。

  • 24言語にわたる精度で1.5〜2.0倍の改善を示し、Deepgram Nova 3やElevenLabs Scribe v2などの専用文字起こしモデルを上回る性能を発揮する。
  • バックグラウンドノイズや電話回線の圧縮といったノイズの多い環境において、競合他社よりも約10倍優れたパフォーマンスを実現する。
  • 会話しながら並列でクエリを推論するため、エージェントの最初の文が終わる前に実行されることが多い、より素早いツール呼び出しが可能になる。
  • 強化学習を活用して短い文を生成し、一度に一つの質問を行うことで、よりシンプルで流暢なユーザーインタラクションを実現する。
  • オーディオ1分あたり0.08ドルで提供され、grok-voice-latestは2026年8月5日にバージョン2.0に自動的にアップグレードされる。

StarlinkでのA/Bテストでは、販売コンバージョン率とサポート封じ込め率が大幅に増加し、プロンプトの編集を必要とせずにユースケース全体でパフォーマンスが向上したことを示している。