NemotronLabs 发布 VoiceChat,一款支持工具调用的开源全双工语音到语音模型
NemotronLabs 推出了 VoiceChat,这是一款开源权重的全双工语音到语音模型,旨在通过统一的流式架构整合监听、转录、推理和说话功能。该系统将流式语音编码器与仅解码器的语言模型相结合,并为智能体文本和结构化函数调用提供并行专用输出流,同时辅以用于增量用户转录的 RNN-T 分支。
NemotronLabs 推出了 VoiceChat,这是一款开源权重的全双工语音到语音模型,旨在通过统一的流式架构整合监听、转录、推理和说话功能。该系统将流式语音编码器与仅解码器的语言模型相结合,并为智能体文本和结构化函数调用提供并行专用输出流,同时辅以用于增量用户转录的 RNN-T 分支。
NemotronLabs 推出了 NemotronLabs VoiceChat,这是一款开源权重的全双工语音到语音模型,在统一的流式架构中集成了原生工具调用能力。该系统将流式语音编码器与仅解码器的语言模型相结合,提供用于智能体文本和结构化函数调用的并行输出流,同时配备辅助的 RNN-T 分支用于增量转录以及流式 TTS 解码器。
SpaceXAI发布了Grok Voice Transcribe 2.0,这是一款通过托管API提供的语音转文本模型,在相同价格点下声称比1.0版本准确率高出两倍。该模型针对嘈杂电话线和竞争声音等困难音频条件设计,支持批量和实时流式处理模式。
xAI 发布了 Grok Voice Transcribe 2.0,这是一款语音转文本模型,其准确率是 1.0 版本的两倍,同时保持相同的价格。该模型基于 Grok Voice 背后的音频基础模型构建,利用独特的实时嘈杂多语言音频数据集,以应对电话线路不稳定和声音竞争等具有挑战性的现实条件。
Google 发布了两个新的语音到语音模型:Gemini 3.8 Live 和 Gemini 3.8 Live Extended Thinking,其结构与 OpenAI 的 GPT-Live 模型相似。
Google 推出了 Gemini 3.8 Live 和 Gemini 3.8 Live Extended Thinking,这是专为实时语音代理设计的原生语音到语音模型,能够在不破坏对话流程的情况下进行推理并执行工具调用。
Google宣布其技术现支持超过70亿人的300多种语言,并推出新工具以改善语音理解、为代表性不足的语言收集数据以及提升无障碍功能。
OpenAI 已在 API 中推出 GPT-Live-1,为开发者提供一个能够同时听和说的单一模型,用于构建支持语音的应用程序。此次发布旨在通过用统一方法取代传统的链式架构,更自然地处理中断和上下文,从而简化语音层开发。
一位AI开发者正在寻求架构建议,以构建一个实时语音AI系统,该系统在保持成本效益和可扩展性的同时,实现大约500毫秒或更短的首字延迟。
Aiden 描述了一种代理架构,该架构需要全双工语音对话以及复杂的视觉推理和设备操作,避免了单一模型同时处理这两者的限制。该解决方案划分了职责:实时语音模型管理对话,而一个单独的、更强的模型执行后台任务,通过任务队列异步协调。
一位用户发布了 F-0310,这是一个零依赖的封装工具,允许在 Windows 上完全本地部署 Coqui XTTS-v2 和 Qwen 2.5,无需使用云 API。
一个新的无依赖部署包装器 F-0310 使得在 Windows 上对 Coqui XTTS-v2 和 Qwen 2.5 进行完全本地、离线的推理成为可能,无需使用云 API。
总部位于巴黎的语音AI公司Gradium推出了Voice Design功能,该功能可根据书面描述生成新的合成语音,无需参考音频。该工具现已在Gradium API和Studio中上线,支持五种语言。
研究人员展示了 TontaubeV1,这是一种文本转语音模型,在保持自然韵律的同时,支持从单张消费级 GPU 进行流式推理。该系统使用 12.5 Hz 的层级 DualCodec 表示法,将语义流与声学细化分离,从而实现低延迟生成。
研究人员推出了 TontaubeV1,这是一种文本转语音模型,在保持自然韵律的同时,支持从单个消费级 GPU 进行流式推理。该系统使用 12.5 Hz 的层次化 DualCodec 表示法,将语义流与声学细化分离开来,从而尽管底层编解码器具有非因果特性,仍可实现因果解码。
AuK技术报告介绍了一个开源基础模型,该模型通过自然语言指令和音频上下文统一了语音生成和编辑。
腾讯已将其用于语音生成和编辑的AuK 1.5B基础模型作为开源软件发布,包括代码和模型权重。
腾讯已将用于语音生成和编辑的 AuK 基础模型开源,包括在 Hugging Face 和 ModelScope 上的代码和权重。此次发布包含 AuK-Flash,这是一种专为快速推理设计的蒸馏变体,仅需 4 步。
Meta超级智能实验室发布了Muse Voice Transcribe,这是一个单一的自回归模型,能够在一个步骤中完成流式自动语音识别(ASR)、20多个说话人的说话人日志分析以及端点检测。该模型以muse-voice-transcribe-1.0的名称在Meta Model API上作为托管API提供。
pipecat-ai 项目发布了 phonellm-alpha-1 模型,在典型的语音代理任务中实现了与 GPT 5.6 相当的性能。