OpenAI ha lanzado GPT-Live-1 en la API, proporcionando a los desarrolladores un único modelo capaz de escuchar y hablar simultáneamente para construir aplicaciones habilitadas por voz. Este lanzamiento tiene como objetivo simplificar el desarrollo de la capa de voz reemplazando las arquitecturas encadenadas tradicionales con un enfoque unificado que maneja interrupciones y contexto de manera más natural.

Las capacidades clave incluyen una mejor gestión de interrupciones mediante razonamiento conjunto sobre audio entrante y saliente, y la capacidad de delegar tareas de razonamiento más profundo a modelos backend como GPT-6 Astra o sistemas de terceros. El modelo admite personalización de tono, ritmo y estilo a través de prompts del sistema, gestiona eficazmente el ruido de fondo y el silencio, y garantiza fiabilidad en sesiones largas.

Las evaluaciones muestran que GPT-Live-1 mejora el rendimiento de Full Duplex Bench en 30 puntos porcentuales respecto a GPT-Realtime-2.1 y se clasifica como #1 en el benchmark Tau3 para inteligencia de agentes de voz cuando se empareja con GPT-6 Astra. Está disponible hoy a $0.05 por minuto para la capa de voz frontend, con opciones de voz ampliadas y disponibilidad de idiomas planificados para los próximos meses.