PolyAI 推出了 Dialog-RSN-1,这是一款直接处理原始来电音频而非依赖转录文本的对话模型。它将轮次管理、语音识别、函数调用和响应生成融合为一个单一的音频感知系统。

  • 该模型将第一个 token 输出为 EMPTY、ONGOING 或 COMPLETE,以管理轮次。
  • 它作为按需探测的请求式 LLM 运行,而非始终在线的流式处理。
  • PolyAI 报告称响应时间低于 300 毫秒,在餐厅集团中相对保留率提高 11%,在保险公司中延迟降低 37%。
  • 该系统在发布时仅支持英语,并通过 PolyAI 的平台交付,不提供开源权重。

Dialog-RSN-1 已在为现有客户处理实时生产通话,可通过早期申请获得新访问权限。