llama.cpp 项目发布了构建版本 b10369,引入了对 pocket-tts 文本转语音模型的支持。此更新包含使用 GEMM 和 col2im 实现转置卷积的新方法,以优化性能。
- 与之前的实现相比,CUDA 上的每帧生成时间减少 80%,CPU 上减少 50%。
- 输出与参考实现匹配,相关系数为 0.999994,且帧数完全相同。
- 语言包现在通过新的 mmproj 键调整语音结束填充和短提示填充。
- 一段长法语文本测试显示生成时间接近参考时间(22.96秒对比 23.44秒),误差在 2% 以内。
该优化在保持保真度的同时显著加速了音频合成,现有的 mmproj 文件必须转换以携带新的配置键。