OpenAI工程师推出GPT-Live,一种去除话轮检测器的全双工语音系统
OpenAI发布了GPT-Live,这是一款第三代语音系统,通过采用能够同时听和说的全双工模型,消除了传统的转接器。这种架构允许更即时和自然的对话,同时通过针对实时性能优化的新系统设计保持低延迟。
OpenAI发布了GPT-Live,这是一款第三代语音系统,通过采用能够同时听和说的全双工模型,消除了传统的转接器。这种架构允许更即时和自然的对话,同时通过针对实时性能优化的新系统设计保持低延迟。
xAI宣布推出Grok Voice Think Fast 2.0,这是一款下一代语音到语音模型,旨在增强智能、转录准确性和对话能力。该更新在先前版本的基础上,显著提升了语音推理、对话能力和工具使用的可靠性。
Google 在其 Google Flow Music 平台推出了最新的音乐生成模型 Lyria 3.5,旨在帮助用户创作更丰富的音轨,并拥有更大的创作控制权。
OpenAI 推出了 GPT-Live-1 和 GPT-Live-1 mini,以驱动重新构建的 ChatGPT Voice,引入支持同时听说的全双工音频处理。该系统将复杂查询委托给 GPT-5.5 等后台推理模型,从而在深度思考进行的同时实现连续对话。
llama.cpp 项目发布了构建版本 b10369,引入了对 pocket-tts 文本转语音模型的支持。此更新包含使用 GEMM 和 col2im 实现转置卷积的新方法,以优化性能。
NVIDIA 已对其 Magpie Multilingual TTS 模型发布更新,通过新增现代标准阿拉伯语、韩语和巴西葡萄牙语,将支持语言扩展至十二种。此次发布还通过更新训练数据和架构变更,提升了现有语言的质量。
NVIDIA发布了NemotronLabs VoiceChat 11B,这是一款面向实时全双工对话的开源11B参数端到端语音转语音模型。与串联ASR、LLM和TTS的级联堆栈不同,该统一网络同时执行流式语音理解和生成,在Full-Duplex-Bench 1.0上测得的平滑切换延迟为448毫秒。
llama.cpp 项目发布了 b10270 版本,引入了对 Qwen3-TTS 模型的支持。此更新包括对 llama-tts 二进制文件的破坏性更改,并实施了重要的架构修改以处理新的文本转语音工作流。
NVIDIA已在Hugging Face上发布了NemotronLabs-VoiceChat-11B语音聊天模型。该仓库被描述为支持全双工通信能力。
一位研究人员发布了OpenGauntlet研究目录,这是一个公共资源,包含关于168个文本转语音(TTS)系统和106个语音转文本(STT)系统的信息。该目录涵盖开源和托管模型、许可证、硬件要求、语言、功能、生命周期状态、来源信息以及可用的已发布基准数据。
PolyAI 推出了 Dialog-RSN-1,这是一款直接处理原始来电音频而非依赖转录文本的对话模型。它将轮次管理、语音识别、函数调用和响应生成融合为一个单一的音频感知系统。
阿里巴巴的通义实验室发布了Qwen-Audio-3.0-TTS,这是一个托管的文本转语音系统,提供两种变体:用于实时交互的Flash和用于高质量生成的Plus。这两个版本均通过阿里云模型工作室提供服务,而非作为可下载的权重。
NymphTech 正在寻求高端语音克隆和语音合成模型的推荐,以增强其 AI 广播电台网络,特别针对多种语言和长篇幅广播。该公司已经推出了一個平台,拥有持久的 AI 人格,如 Trinity 和 Mark,其中 Trinity 自 6 月 9 日起持续广播。