xAI 发布了 Grok Voice Transcribe 2.0,这是一款语音转文本模型,其准确率是 1.0 版本的两倍,同时保持相同的价格。该模型基于 Grok Voice 背后的音频基础模型构建,利用独特的实时嘈杂多语言音频数据集,以应对电话线路不稳定和声音竞争等具有挑战性的现实条件。

  • 在 Artificial Analysis 公共排行榜的 32 个流式模型中准确率排名第一。
  • 将短短语的词错误率从 20.6% 降低到 6.8%,标志着其最大的多语言改进。
  • 在电话音频测试的所有模型中领先,并在四个内部生产数据集中提升了性能。
  • 自动检测语言并支持在单次处理中为数十种语言进行录音过程中的语言切换。

该更新将很快成为 Speech-to-Text API 的默认设置,1.0 版本计划在未来几周内停止服务。