OpenAI a publié GPT-Live, un système vocal de troisième génération qui élimine le détecteur de tour traditionnel en utilisant un modèle full-duplex capable d'écouter et de parler simultanément. Cette architecture permet des conversations plus immédiates et naturelles tout en maintenant une faible latence grâce à une nouvelle conception du système optimisée pour les performances en temps réel.

  • Le système diffuse l'audio entrant vers le modèle vocal et renvoie la parole sortante à l'utilisateur, gérant un raisonnement plus approfondi ou l'utilisation d'outils via des modèles de pointe comme GPT-5.5 sur un chemin asynchrone séparé.
  • Le flux multimédia est séparé de la logique applicative en utilisant un chemin rapide dédié, avec une logique d'inférence écrite en Go pour améliorer la fluidité de la livraison des trames.
  • Un mécanisme de transfert transparent permet une compaction dynamique du contexte et des transitions d'instance de modèle sans interrompre la boucle multimédia.
  • Le protocole WebRTC Abridged Roundtrip (WARP) réduit les allers-retours réseau de démarrage de six à un.

Cette fondation alimente les fonctionnalités de ChatGPT Voice, y compris le contrôle informatique et la coordination d'agents dans l'application de bureau, en s'assurant que les personnalisations applicatives n'affectent pas la réactivité du chemin multimédia en direct.