OpenAI ने GPT-Live जारी किया है, एक तीसरी पीढ़ी का वॉइस सिस्टम जो एक फुल-डप्लेक्स मॉडल का उपयोग करके पारंपरिक टर्न डिटेक्टर को समाप्त करता है, जो एक साथ सुनने और बोलने में सक्षम है। यह आर्किटेक्चर वास्तविक समय की प्रदर्शन के लिए अनुकूलित नए सिस्टम डिज़ाइन के माध्यम से कम लेटेंसी बनाए रखते हुए अधिक तत्काल और प्राकृतिक संवादों को सक्षम बनाता है।

  • सिस्टम आने वाले ऑडियो को वॉइस मॉडल में स्ट्रीम करता है और उपयोगकर्ता के लिए बाउंड स्पिच वापस भेजता है, जबकि GPT-5.5 जैसे फ्रंटियर मॉडल्स पर एक अलग एसेंक्रोनस पथ के माध्यम से गहरी तर्क या टूल उपयोग को संभालता है।
  • वेब रियल-टाइम कम्युनिकेशन (WebRTC) एब्रेज्ड राउंडट्रिप प्रोटोकॉल (WARP) स्टार्टअप नेटवर्क राउंड ट्रिप्स को छह से घटाकर एक कर देता है।
  • एक सहज हैंडऑफ तंत्र गतिशील संदर्भ संपीड़न और मॉडल इंस्टेंस ट्रांजिशन की अनुमति देता है बिना मीडिया लूप को बाधित किए।

यह आधार ChatGPT Voice में क्षमताओं को संचालित करता है, जिसमें डेस्कटॉप ऐप में कंप्यूटर नियंत्रण और एजेंट समन्वय शामिल हैं, यह सुनिश्चित करते हुए कि ऐप कस्टमाइज़ेशन लाइव मीडिया पथ की प्रतिक्रियाशीलता को प्रभावित नहीं करता।