PolyAI는 트랜스크립트에 의존하는 대신 발신자 오디오를 직접 처리하는 대화 모델인 Dialog-RSN-1을 소개했습니다. 이 모델은 턴 테이킹, 음성 인식, 함수 호출 및 응답 생성을 단일 오디오 인식 시스템으로 통합합니다.

  • 모델은 턴 테이킹을 관리하기 위해 첫 번째 토큰을 EMPTY, ONGOING 또는 COMPLETE로 출력합니다.
  • 항상 활성화된 스트림 대신 필요할 때 probing되는 요청 기반 LLM으로 실행됩니다.
  • PolyAI는 300ms 미만의 응답 시간, 레스토랑 그룹에서 상대적 컨테이너먼트 +11%, 보험사에서의 레이턴시 −37%를 보고했습니다.
  • 시스템은 출시 시 영어 전용이며 오픈 가중치 없이 PolyAI 플랫폼을 통해 제공됩니다.

Dialog-RSN-1은 이미 기존 고객의 라이브 프로덕션 전화를 처리하고 있으며, 조기 요청을 통해 새로운 접근이 가능합니다.