PolyAIは、トランスクリプトに依存するのではなく、発信者の生音声を直接処理する対話モデル「Dialog-RSN-1」を発表しました。これは、ターンテイキング、音声認識、関数呼び出し、応答生成を単一のオーディオ対応システムに融合しています。
- モデルは、ターンテイキングを管理するために最初のトークンをEMPTY、ONGOING、またはCOMPLETEとして出力します。
- 常時ストリーミングではなく、必要に応じてプローブされるリクエストベースのLLMとして動作します。
- PolyAIによると、応答時間は300ms未満、レストラングループでの相対的コンテインメントが11%向上し、保険会社でレイテンシが37%短縮されました。
- システムはリリース時に英語のみ対応で、オープンウェイトなしでPolyAIのプラットフォームを通じて提供されます。
Dialog-RSN-1はすでに既存顧客のライブ本番通話を処理しており、早期リクエストにより新しいアクセスが可能です。