OpenAI 已在 API 中推出 GPT-Live-1,为开发者提供一个能够同时听和说的单一模型,用于构建支持语音的应用程序。此次发布旨在通过用统一方法取代传统的链式架构,更自然地处理中断和上下文,从而简化语音层开发。
关键功能包括:通过对输入和输出音频进行联合推理来改进中断处理能力,以及将更深层次的推理任务委托给 GPT-6 Astra 或第三方系统等后端模型。该模型支持通过系统提示自定义语调、语速和风格,能有效管理背景噪音和静音,并确保在长会话中的可靠性。
评估显示,GPT-Live-1 在 Full Duplex Bench 性能上比 GPT-Realtime-2.1 提升了 30 个百分点;当与 GPT-6 Astra 搭配使用时,在 Tau3 语音智能体智能基准测试中排名第一。该模型现已上线,前端语音层定价为每分钟 0.05 美元,未来几个月还将扩展语音选项和语言支持。