PolyAI ha presentado Dialog-RSN-1, un modelo de diálogo que procesa el audio crudo del llamante directamente en lugar de depender de transcripciones. Fusiona el turno de palabra, el reconocimiento de voz, la llamada a funciones y la generación de respuestas en un único sistema consciente del audio.

  • El modelo emite el primer token como EMPTY, ONGOING o COMPLETE para gestionar los turnos.
  • Se ejecuta como un LLM bajo demanda consultado a petición, en lugar de un flujo siempre activo.
  • PolyAI reporta respuestas en menos de 300 ms, un aumento del 11% en la contención relativa en un grupo de restaurantes y una reducción del 37% en la latencia para una aseguradora.
  • El sistema es solo en inglés en su lanzamiento y se entrega a través de la plataforma de PolyAI sin pesos abiertos.

Dialog-RSN-1 ya está manejando llamadas de producción en vivo para clientes existentes, con nuevo acceso disponible mediante solicitud anticipada.