Meta超级智能实验室发布了Muse Voice Transcribe,这是一个单一的自回归模型,能够在一个步骤中完成流式自动语音识别(ASR)、20多个说话人的说话人日志分析以及端点检测。该模型以muse-voice-transcribe-1.0的名称在Meta Model API上作为托管API提供。
- 在Artificial Analysis AA-WER Streaming基准测试中,其最终转录词错误率为3.1%,延迟为0.16秒。
- 通过强化学习训练自适应延迟策略,针对每个单词进行变化以平衡准确性和速度。
- 该模型支持超过一小时的音频输入以及70多种语言的原生代码切换。
- 定价为每1,000分钟音频3.00美元,低于Cartesia Ink-2和ElevenLabs Scribe v2 Realtime等竞争对手的价格。
该系统为Meta AI for Mac和Muse Code中的听写功能提供支持,提供了一个统一的解决方案,减少了与多模型堆栈相关的延迟和故障模式。