OpenAI выпустила GPT-Live, систему голосовой связи третьего поколения, которая устраняет традиционный детектор очереди за счёт использования полнодуплексной модели, способной одновременно слушать и говорить. Эта архитектура обеспечивает более мгновенные и естественные разговоры, сохраняя при этом низкую задержку благодаря новому дизайну системы, оптимизированному для работы в реальном времени.

  • Система передаёт входящий аудиопоток в голосовую модель, а исходящую речь — обратно пользователю, обрабатывая более сложные рассуждения или использование инструментов через передовые модели, такие как GPT-5.5, по отдельному асинхронному каналу.
  • Медиапоток отделён от логики приложения с помощью выделенного быстрого канала, при этом логика вывода (inference) написана на Go для повышения плавности доставки кадров.
  • Механизм бесшовной передачи позволяет динамически сжимать контекст и переходить между экземплярами модели без прерывания медиапотока.
  • Протокол WebRTC Abridged Roundtrip Protocol (WARP) сокращает количество сетевых раундов при запуске с шести до одного.

Эта основа обеспечивает возможности в ChatGPT Voice, включая управление компьютером и координацию агентов в десктопном приложении, гарантируя, что пользовательские настройки приложения не влияют на отзывчивость живого медиапотока.