OpenAI ने API में GPT-Live-1 लॉन्च किया है, जो डेवलपर्स को एक ऐसा मॉडल प्रदान करता है जो एक साथ सुनने और बोलने की क्षमता रखता है ताकि वे आवाज़ से संचालित ऐप्स बना सकें। यह रिलीज पारंपरिक चेन्ड आर्किटेक्चर को एक एकीकृत दृष्टिकोण से बदलकर, जो विघटनों और संदर्भ को अधिक प्राकृतिक ढंग से संभालता है, आवाज़ परत विकास को सरल बनाने का लक्ष्य रखती है।
मुख्य क्षमताओं में आने वाली और जाने वाली ऑडियो पर संयुक्त तर्क के माध्यम से बेहतर विघटन हैंडलिंग शामिल है, और GPT-6 Astra या थर्ड-पार्टी सिस्टम जैसे बैकएंड मॉडल्स को गहन तर्क कार्यों को सौंपने की क्षमता है। मॉडल सिस्टम प्रॉम्प्ट के माध्यम से टोन, गति और शैली अनुकूलन का समर्थन करता है, पृष्ठभूमि के शोर और मौन को प्रभावी ढंग से संभालता है, और लंबी सत्रों में विश्वसनीयता सुनिश्चित करता है।
मूल्यांकनों से पता चलता है कि GPT-Live-1 ने GPT-Realtime-2.1 की तुलना में Full Duplex Bench प्रदर्शन में 30 प्रतिशत अंक की सुधार दिखाई है, और GPT-6 Astra के साथ जोड़े जाने पर आवाज़-एजेंट बुद्धिमत्ता के लिए Tau3 बेंचमार्क पर #1 स्थान हासिल किया है। यह आज फ्रंट-एंड आवाज़ परत के लिए प्रति मिनट $0.05 की दर पर उपलब्ध है, और आने वाले महीनों में विस्तारित आवाज़ विकल्पों और भाषा उपलब्धता की योजना है।