Google推出Gemini 3.8 Flash和Flash-Lite文本转语音模型
Google发布了两个新的文本转语音模型:Gemini 3.8 Flash TTS和Gemini 3.8 Flash-Lite TTS,将Gemini Audio系列扩展至为创作者、开发者和企业提供动态语音生成能力。
Google发布了两个新的文本转语音模型:Gemini 3.8 Flash TTS和Gemini 3.8 Flash-Lite TTS,将Gemini Audio系列扩展至为创作者、开发者和企业提供动态语音生成能力。
xAI 发布了 Grok Voice Transcribe 2.0,这是一款语音转文本模型,其准确率是 1.0 版本的两倍,同时保持相同的价格。该模型基于 Grok Voice 背后的音频基础模型构建,利用独特的实时嘈杂多语言音频数据集,以应对电话线路不稳定和声音竞争等具有挑战性的现实条件。
OpenAI 已在 API 中推出 GPT-Live-1,为开发者提供一个能够同时听和说的单一模型,用于构建支持语音的应用程序。此次发布旨在通过用统一方法取代传统的链式架构,更自然地处理中断和上下文,从而简化语音层开发。
Google宣布其技术现支持超过70亿人的300多种语言,并推出新工具以改善语音理解、为代表性不足的语言收集数据以及提升无障碍功能。
Google 通过 Gemini API 和 AI Studio 发布了 Gemini 3.8 Flash TTS 和 Flash-Lite TTS,在 Hume 的 Voice Design Benchmark 和 Voice Arena 六个语言中均名列前茅。
Google 推出了 Gemini 3.8 Live 和 Gemini 3.8 Live Extended Thinking,这是专为实时语音代理设计的原生语音到语音模型,能够在不破坏对话流程的情况下进行推理并执行工具调用。
开放TTS排行榜已发布,旨在通过使用客观指标而非仅依赖缓慢的竞技场式人类偏好评分,解决语音合成(TTS)评估中的碎片化和缺乏标准化问题。它使用Qwen3 ASR和WavLM嵌入来评估模型的可懂度、速度和说话人相似度。
阿里巴巴通义千问团队发布了Qwen-Audio-3.1,这是一个包含五个模型的音频堆栈,其中包括全新的Qwen-Audio-3.1-Realtime-plus,这是一款专为具备推理和工具使用能力的语音代理设计的全双工语音模型。此次发布还引入了ASR服务价格最高降低95%的优惠。
llama.cpp 项目发布了版本 b11190,其中包含对 LFM2 音频模型中使用的 mel 预处理器的修复。此更改解决了导致 4.5% 的英语和 6.5% 的日语测试语句产生不同贪婪转录的差异。
Google发布了两个新的文本转语音模型:Gemini 3.8 Flash TTS和Gemini 3.8 Flash-Lite TTS,作为其Gemini Audio系列的一部分。这些模型引入了通过自然语言提示进行生成式语音设计,并通过Gemini API和Google AI Studio实现逐行表演指导。
NVIDIA发布了Nemotron 3 Diarization,这是一个开源权重的说话人日志模型,在Hugging Face上以OpenMDW License 1.1许可证提供。该100M参数模型使用单个检查点,在实时或离线模式下追踪多达8名重叠说话人。
Google发布了两个新的文本转语音模型:gemini-3.8-flash-tts和gemini-3.8-flash-lite-tts,内置超过2000种声音库。
NVIDIA 发布了 Nemotron 3 Diarization,这是一款用于实时说话人分离的开源权重、100M 参数模型,支持多达八位说话人。该模型在 VoiceArena 的 Diarization-Bench 排行榜上排名第一,说话人错误率(DER)为 14.72%,比排名第二的系统相对降低了约 24%。
NemotronLabs 推出了 VoiceChat,这是一款开源权重的全双工语音到语音模型,旨在通过统一的流式架构整合监听、转录、推理和说话功能。该系统将流式语音编码器与仅解码器的语言模型相结合,并为智能体文本和结构化函数调用提供并行专用输出流,同时辅以用于增量用户转录的 RNN-T 分支。
NemotronLabs 推出了 NemotronLabs VoiceChat,这是一款开源权重的全双工语音到语音模型,在统一的流式架构中集成了原生工具调用能力。该系统将流式语音编码器与仅解码器的语言模型相结合,提供用于智能体文本和结构化函数调用的并行输出流,同时配备辅助的 RNN-T 分支用于增量转录以及流式 TTS 解码器。
SpaceXAI发布了Grok Voice Transcribe 2.0,这是一款通过托管API提供的语音转文本模型,在相同价格点下声称比1.0版本准确率高出两倍。该模型针对嘈杂电话线和竞争声音等困难音频条件设计,支持批量和实时流式处理模式。
Google 发布了两个新的语音到语音模型:Gemini 3.8 Live 和 Gemini 3.8 Live Extended Thinking,其结构与 OpenAI 的 GPT-Live 模型相似。
一位AI开发者正在寻求架构建议,以构建一个实时语音AI系统,该系统在保持成本效益和可扩展性的同时,实现大约500毫秒或更短的首字延迟。
Aiden 描述了一种代理架构,该架构需要全双工语音对话以及复杂的视觉推理和设备操作,避免了单一模型同时处理这两者的限制。该解决方案划分了职责:实时语音模型管理对话,而一个单独的、更强的模型执行后台任务,通过任务队列异步协调。
一位用户发布了 F-0310,这是一个零依赖的封装工具,允许在 Windows 上完全本地部署 Coqui XTTS-v2 和 Qwen 2.5,无需使用云 API。