OpenAI telah merilis GPT-Live, sistem suara generasi ketiga yang menghilangkan detektor giliran tradisional dengan menggunakan model full-duplex yang mampu mendengarkan dan berbicara secara bersamaan. Arsitektur ini memungkinkan percakapan yang lebih langsung dan alami sambil mempertahankan latensi rendah melalui desain sistem baru yang dioptimalkan untuk kinerja waktu nyata.
- Sistem mengalirkan audio masuk ke model suara dan ucapan keluar kembali ke pengguna, menangani penalaran yang lebih dalam atau penggunaan alat melalui model frontier seperti GPT-5.5 pada jalur asinkron terpisah.
- Aliran media dipisahkan dari logika aplikasi menggunakan jalur cepat khusus, dengan logika inferensi ditulis dalam Go untuk meningkatkan kelancaran pengiriman frame.
- Mekanisme perpindahan mulus memungkinkan kompresi konteks dinamis dan transisi instance model tanpa mengganggu loop media.
- Protokol WARP (WebRTC Abridged Roundtrip) mengurangi jumlah putaran jaringan saat startup dari enam menjadi satu.
Fondasi ini mendukung kemampuan di ChatGPT Voice, termasuk kontrol komputer dan koordinasi agen di aplikasi desktop, dengan memastikan bahwa kustomisasi aplikasi tidak memengaruhi responsivitas jalur media langsung.