OpenAI a lancé GPT-Live-1 dans l'API, offrant aux développeurs un modèle unique capable d'écouter et de parler simultanément pour créer des applications activées par la voix. Cette version vise à simplifier le développement de la couche vocale en remplaçant les architectures traditionnelles en chaîne par une approche unifiée qui gère plus naturellement les interruptions et le contexte.
Les capacités clés incluent une meilleure gestion des interruptions grâce à un raisonnement conjoint sur l'audio entrant et sortant, et la possibilité de déléguer des tâches de raisonnement plus approfondies à des modèles backend comme GPT-6 Astra ou des systèmes tiers. Le modèle prend en charge la personnalisation du ton, du rythme et du style via des invites système, gère efficacement le bruit de fond et le silence, et assure la fiabilité sur de longues sessions.
Les évaluations montrent que GPT-Live-1 améliore les performances du benchmark Full Duplex Bench de 30 points de pourcentage par rapport à GPT-Realtime-2.1 et se classe n°1 sur le benchmark Tau3 pour l'intelligence des agents vocaux lorsqu'il est associé à GPT-6 Astra. Il est disponible dès aujourd'hui à 0,05 $ par minute pour la couche vocale front-end, avec des options vocales élargies et une disponibilité linguistique prévues dans les mois à venir.