PolyAI a présenté Dialog-RSN-1, un modèle de dialogue qui traite directement l'audio brut de l'appelant plutôt que de s'appuyer sur des transcriptions. Il fusionne la gestion des tours, la reconnaissance vocale, l'appel de fonctions et la génération de réponses en un seul système conscient de l'audio.
- Le modèle émet le premier token comme EMPTY, ONGOING ou COMPLETE pour gérer les tours.
- Il fonctionne comme un LLM basé sur une requête sondé à la demande plutôt qu'un flux toujours actif.
- PolyAI rapporte des réponses en moins de 300 ms, une augmentation de 11 % du taux de rétention relatif dans un groupe de restaurants et une réduction de 37 % de la latence pour un assureur.
- Le système est uniquement en anglais au lancement et est livré via la plateforme de PolyAI sans poids ouverts.
Dialog-RSN-1 gère déjà des appels de production en direct pour les clients existants, avec un nouvel accès disponible sur demande anticipée.