OpenAI ha lanzado GPT-Live, un sistema de voz de tercera generación que elimina el detector de turno tradicional mediante un modelo full-dúplex capaz de escuchar y hablar simultáneamente. Esta arquitectura permite conversaciones más inmediatas y naturales mientras mantiene una baja latencia gracias a un nuevo diseño del sistema optimizado para el rendimiento en tiempo real.
- El sistema transmite el audio entrante al modelo de voz y devuelve el habla saliente al usuario, gestionando razonamientos más profundos o el uso de herramientas a través de modelos de vanguardia como GPT-5.5 en una ruta asíncrona separada.
- El flujo multimedia se separa de la lógica de la aplicación utilizando un camino rápido dedicado, con la lógica de inferencia escrita en Go para mejorar la fluidez en la entrega de cuadros.
- Un mecanismo de traspaso sin interrupciones permite la compresión dinámica del contexto y las transiciones de instancia del modelo sin interrumpir el bucle multimedia.
- El Protocolo de Vuelta Rápida Abreviada de WebRTC (WARP) reduce las vueltas de red de inicio desde seis a una.
Esta base impulsa capacidades en ChatGPT Voice, incluyendo el control de la computadora y la coordinación de agentes en la aplicación de escritorio, asegurando que las personalizaciones de la aplicación no afecten la capacidad de respuesta de la ruta multimedia en vivo.