llama.cpp b10270 添加对 Qwen3-TTS 的支持,并包含 llama-tts 的破坏性更改
llama.cpp 项目发布了 b10270 版本,引入了对 Qwen3-TTS 模型的支持。此更新包括对 llama-tts 二进制文件的破坏性更改,并实施了重要的架构修改以处理新的文本转语音工作流。
llama.cpp 项目发布了 b10270 版本,引入了对 Qwen3-TTS 模型的支持。此更新包括对 llama-tts 二进制文件的破坏性更改,并实施了重要的架构修改以处理新的文本转语音工作流。
NVIDIA已在Hugging Face上发布了NemotronLabs-VoiceChat-11B语音聊天模型。该仓库被描述为支持全双工通信能力。
OpenAI发布了GPT-Live,这是一款第三代语音系统,通过采用能够同时听和说的全双工模型,消除了传统的转接器。这种架构允许更即时和自然的对话,同时通过针对实时性能优化的新系统设计保持低延迟。
一位研究人员发布了OpenGauntlet研究目录,这是一个公共资源,包含关于168个文本转语音(TTS)系统和106个语音转文本(STT)系统的信息。该目录涵盖开源和托管模型、许可证、硬件要求、语言、功能、生命周期状态、来源信息以及可用的已发布基准数据。
PolyAI 推出了 Dialog-RSN-1,这是一款直接处理原始来电音频而非依赖转录文本的对话模型。它将轮次管理、语音识别、函数调用和响应生成融合为一个单一的音频感知系统。
xAI宣布推出Grok Voice Think Fast 2.0,这是一款下一代语音到语音模型,旨在增强智能、转录准确性和对话能力。该更新在先前版本的基础上,显著提升了语音推理、对话能力和工具使用的可靠性。
Google 在其 Google Flow Music 平台推出了最新的音乐生成模型 Lyria 3.5,旨在帮助用户创作更丰富的音轨,并拥有更大的创作控制权。
阿里巴巴的通义实验室发布了Qwen-Audio-3.0-TTS,这是一个托管的文本转语音系统,提供两种变体:用于实时交互的Flash和用于高质量生成的Plus。这两个版本均通过阿里云模型工作室提供服务,而非作为可下载的权重。
OpenAI 推出了 GPT-Live-1 和 GPT-Live-1 mini,以驱动重新构建的 ChatGPT Voice,引入支持同时听说的全双工音频处理。该系统将复杂查询委托给 GPT-5.5 等后台推理模型,从而在深度思考进行的同时实现连续对话。
NymphTech 正在寻求高端语音克隆和语音合成模型的推荐,以增强其 AI 广播电台网络,特别针对多种语言和长篇幅广播。该公司已经推出了一個平台,拥有持久的 AI 人格,如 Trinity 和 Mark,其中 Trinity 自 6 月 9 日起持续广播。
研究人员提出了一种框架,使用音频感知大型语言模型(ALLMs)作为细粒度裁判,以验证生成音频中目标事件的存在和时间关系。这种方法解决了现有文本到音频模型经常无法遵循涉及多个声音事件及其顺序的指令的问题。
一项研究审计了用作语音评估自动裁判的大型音频语言模型(LALMs)中的协议级捷径,揭示出与人类评分的高度一致并不能保证判决是基于实际音频的。该研究考察了三种部署协议:特征蓝图裁判、参考条件裁判以及针对六名裁判和四个属性的成对 A/B 比较。
该研究调查了在英语和日语二语(L2)语音中,利用自监督WavLM表示上的动态时间规整(DTW)来评估发音准确性、节奏和语调,且无需标注训练数据。将学习者语音与母语者模板进行比较的基础DTW方法,在整体和句子层面的发音评分上超过了人类的一致性。
开源框架 Audient 为 LLM 代理提供本地音频感知层,持续处理声音并通过使用构建概念记忆。它使用 CLAP embeddings、Whisper、Silero VAD 和 sqlite-vec 来过滤、生成指纹并识别音频事件,而无需进行频繁的 LLM 调用。
研究人员证明,离散扩散语言模型可以通过在少量去噪步骤中并行优化整个转录文本来转录语音,而不是使用自回归解码器。
Hume 推出了 Real World VoiceEQ,这是一个旨在通过评估系统超越文本转录识别和生成声学信息的能力,来衡量语音交互中人类质量的基准。该基准使用源自 785,000 个 TTS 和 48,000 个 STS 人类评分的超过 60 项指标,在 15 多个维度上评估了 40 多个专有和开源模型。
audio.cpp 项目发布了 0.3 版本,引入了五种新的文本转语音模型:Supertonic 3、MOSS-TTS-Local、MOSS-TTS-Nano、IndexTTS2 和 Irodori-TTS。此次更新还增加了 GGUF 支持,将逐个模型推出。
研究人员提出了统一梯度投影(UGP),一种在低资源语言上微调大型预训练ASR模型(如Whisper)时减轻灾难性遗忘的方法。UGP通过在统一投影空间内使用来自语言平衡重放的参考梯度来约束参数更新,有效地均衡了各语言的贡献并减少了主导语言的偏差。
作者介绍了 Cicero,这是一个开源项目,为 AI 代理提供自托管的双向语音交互。与单向听写工具不同,Cicero 允许代理通过 Telegram 说话并呼叫用户,同时将所有音频保留在本地。
Hugging Face 论坛的一位开发者希望了解 Bland.ai、Retell 和 Vapi 等生产平台如何在不依赖庞大手写系统提示词的情况下管理提示词编排。作者描述了其当前使用 FastAPI、Sarvam STT/TTS 和 Pipecat SmartTurn V3 的实现,指出手动按状态注入会导致复杂性增加以及边缘情况失败。