pipecat-ai 项目发布了 phonellm-alpha-1 模型,在典型的语音代理任务中实现了与 GPT 5.6 相当的性能。
- 该模型的延迟仅为对比基准的三分之一。
- 其成本约为参考解决方案的十八分之一。
pipecat-ai 项目发布了 phonellm-alpha-1 模型,在典型的语音代理任务中实现了与 GPT 5.6 相当的性能。
llama.cpp 项目发布了构建版本 b10369,引入了对 pocket-tts 文本转语音模型的支持。此更新包含使用 GEMM 和 col2im 实现转置卷积的新方法,以优化性能。
audio.cpp 项目发布了 0.3 版本,引入了五种新的文本转语音模型:Supertonic 3、MOSS-TTS-Local、MOSS-TTS-Nano、IndexTTS2 和 Irodori-TTS。此次更新还增加了 GGUF 支持,将逐个模型推出。
一名用户测试了在CPU上作为ONNX模型运行的Qwen3-ASR和Kokoro-TTS的延迟,以确定在语音助手管道中可以从GPU卸载多少处理负载。
audio.cpp 项目已更新其原生 C++/GGML 框架,以包含语音识别和合成的初始流式传输支持,以及四个新的 ASR/STT 模型:Nemotron 3.5 ASR、Higgs Audio STT、VibeVoice ASR 和 Hviske ASR。
一位开发者创建了一个 Android 应用程序,可在移动设备上本地运行 Qwen3TTS 0.6B 模型。该应用利用基于 GGML 的自定义 C++ 后端,实现无需依赖云端即可进行文本转语音处理。
我们使用 Cookie 来统计访问量并改进网站。您可以接受或拒绝分析 Cookie。 隐私政策