A PolyAI apresentou o Dialog-RSN-1, um modelo de diálogo que processa o áudio bruto da chamada diretamente, em vez de depender de transcrições. Ele funde a gestão de turnos, reconhecimento de fala, chamada de funções e geração de respostas em um único sistema consciente de áudio.
- O modelo emite o primeiro token como EMPTY, ONGOING ou COMPLETE para gerenciar os turnos.
- Ele funciona como um LLM sob demanda sondado conforme necessário, em vez de um fluxo sempre ativo.
- A PolyAI relata respostas em menos de 300 ms, aumento de 11% na contenção relativa em um grupo de restaurantes e redução de 37% na latência para uma seguradora.
- O sistema é apenas em inglês no lançamento e é entregue através da plataforma da PolyAI sem pesos abertos.
O Dialog-RSN-1 já está lidando com chamadas de produção ao vivo para clientes existentes, com novo acesso disponível por solicitação antecipada.