विषय · Voice & audio
lab OpenAI News · 11 दिन पहले · 15 बार देखा गया

OpenAI इंजीनियरों ने GPT-Live बनाया, एक फुल-डप्लेक्स वॉइस सिस्टम जो टर्न डिटेक्टर को हटाता है

OpenAI ने GPT-Live जारी किया है, एक तीसरी पीढ़ी का वॉइस सिस्टम जो एक फुल-डप्लेक्स मॉडल का उपयोग करके पारंपरिक टर्न डिटेक्टर को समाप्त करता है, जो एक साथ सुनने और बोलने में सक्षम है। यह आर्किटेक्चर वास्तविक समय की प्रदर्शन के लिए अनुकूलित नए सिस्टम डिज़ाइन के माध्यम से कम लेटेंसी बनाए रखते हुए अधिक तत्काल और प्राकृतिक संवादों को सक्षम बनाता है।

lab xAI News · 16 दिन पहले · 28 बार देखा गया

xAI ने Grok Voice Think Fast 2.0 जारी किया, जिसमें सुधारी गई वक्त्व तर्कशक्ति और प्रतिलिपिकरण सटीकता है

xAI ने Grok Voice Think Fast 2.0 की घोषणा की, जो एक अगली पीढ़ी का speech-to-speech voice मॉडल है जिसे बुद्धिमत्ता, प्रतिलिपिकरण सटीकता और संवादात्मक क्षमताओं को बढ़ाने के लिए डिज़ाइन किया गया है। यह अपडेट अपने पूर्ववर्ती पर निर्माण करता हुआ speech reasoning, संवादात्मक क्षमता और tool use विश्वसनीयता में महत्वपूर्ण लाभ पेश करता है।

lab Google DeepMind Blog · 16 दिन पहले · 31 बार देखा गया

Google ने Flow Music में संगीतमयता और वोकल्स में उन्नति के साथ Lyria 3.5 लॉन्च किया

Google ने Google Flow Music के भीतर अपने नवीनतम संगीत जनरेशन मॉडल, Lyria 3.5 को लॉन्च किया है ताकि उपयोगकर्ताओं को अधिक रचनात्मक नियंत्रण के साथ समृद्ध ट्रैक बनाने में मदद मिल सके।

media The Batch · 28 दिन पहले GPQA Diamond · 84.2% · 4 बार देखा गया

OpenAI ने फुल-डप्लेक्स वॉइस मॉडल्स जारी किए और जर्मन अदालत ने Google को AI ओवरव्यू के लिए जिम्मेदार ठहराया

OpenAI ने पुनर्निर्मित ChatGPT Voice को संचालित करने के लिए GPT-Live-1 और GPT-Live-1 mini लॉन्च किए हैं, जो समानात्र सुनने और बोलने की अनुमति देने वाले फुल-डप्लेक्स ऑडियो प्रोसेसिंग को पेश करते हैं। सिस्टम जटिल क्वेरीज़ को GPT-5.5 जैसे बैकग्राउंड रीजनिंग मॉडल्स को सौंपता है, जिससे गहरी सोच चलते हुए निरंतर संवाद संभव होता है।

github llama.cpp · 3 दिन पहले · 9 बार देखा गया

llama.cpp b10369 में pocket-tts समर्थन जोड़ा गया है, CUDA जनरेशन 80% तेज

llama.cpp प्रोजेक्ट ने बिल्ड b10369 जारी किया, जिसमें pocket-tts टेक्स्ट-टू-स्पीच मॉडल के लिए समर्थन शामिल है। इस अपडेट में प्रदर्शन को अनुकूलित करने के लिए GEMM और col2im का उपयोग करके ट्रांसपोज्ड कन्वोल्यूशन्स की एक नई कार्यान्वयन शामिल है।

lab Hugging Face Blog · 4 दिन पहले · 8 बार देखा गया

NVIDIA Magpie TTS में अरबी, कोरियाई, पुर्तगाली जोड़े गए और गुणवत्ता में सुधार

NVIDIA ने अपने Magpie Multilingual TTS मॉडल में एक अपडेट जारी किया है, जिसमें आधुनिक मानक अरबी, कोरियाई और ब्राज़ीलियन पुर्तगाली के जुड़ने के साथ दस भाषाओं का समर्थन बढ़ाकर बारह कर दिया गया है। इस रिलीज में अपडेटेड ट्रेनिंग डेटा और आर्किटेक्चरल बदलावों के माध्यम से मौजूदा भाषाओं में गुणवत्ता में भी सुधार शामिल है।

media MarkTechPost · 5 दिन पहले · 13 बार देखा गया

NVIDIA ने NemotronLabs VoiceChat 11B जारी किया, जो ~450 ms टर्न-टेकिंग के साथ एक खुला फुल-डप्लेक्स स्पीच-टू-स्पीच मॉडल है

NVIDIA ने NemotronLabs VoiceChat 11B जारी किया है, जो रियल-टाइम, फुल-डप्लेक्स संवाद के लिए डिज़ाइन किया गया एक खुला 11B पैरामीटर एंड-टू-एंड स्पीच-टू-स्पीच मॉडल है। कैस्केडेड स्टैक के विपरीत जो ASR, LLM, और TTS को चेन करते हैं, यह यूनिफाइड नेटवर्क एक साथ स्ट्रीमिंग स्पीच समझ और जनरेशन करता है, जिसने Full-Duplex-Bench 1.0 पर मापा गया स्मूथ टर्न-टेकिंग लेटेंसी 448 ms प्राप्त किया।

github llama.cpp · 10 दिन पहले · 8 बार देखा गया

llama.cpp b10270 ने Qwen3-TTS समर्थन जोड़ा है और llama-tts में ब्रेकिंग बदलाव किए हैं

llama.cpp प्रोजेक्ट ने संस्करण b10270 जारी किया, जिसमें Qwen3-TTS मॉडल के लिए समर्थन पेश किया गया है। इस अपडेट में llama-tts बाइनरी के लिए एक ब्रेकिंग बदलाव शामिल है और नए टेक्स्ट-टू-स्पीच वर्कफ़्लो को संभालने के लिए महत्वपूर्ण आर्किटेक्चरल संशोधन लागू किए गए हैं।

media r/LocalLLaMA · 11 दिन पहले

NVIDIA ने Hugging Face पर NemotronLabs-VoiceChat-11B मॉडल जारी किया

NVIDIA ने Hugging Face पर NemotronLabs-VoiceChat-11B वॉइस चैट मॉडल उपलब्ध कराया है। रिपॉजिटरी को पूर्ण डुप्लेक्स संचार क्षमताओं का समर्थन करने के रूप में वर्णित किया गया है।

media Hugging Face Forums · 12 दिन पहले · 8 बार देखा गया

OpenGauntlet ने 168 TTS और 106 STT प्रणालियों का कैटलॉग प्रकाशित किया

एक शोधकर्ता ने OpenGauntlet शोध कैटलॉग प्रकाशित किया है, जो 168 टेक्स्ट-टू-स्पीच (TTS) प्रणालियों और 106 स्पीच-टू-टेक्स्ट (STT) प्रणालियों के बारे में जानकारी वाला एक सार्वजनिक संसाधन है। डायरेक्ट्रीज़ ओपन और होस्टेड मॉडल्स, लाइसेंसिंग, हार्डवेयर आवश्यकताओं, भाषाओं, क्षमताओं, जीवन चक्र की स्थिति, स्रोत जानकारी और उपलब्ध होने पर प्रकाशित बेंचमार्क डेटा को कवर करती हैं।

media MarkTechPost · 15 दिन पहले · 18 बार देखा गया

PolyAI ने Dialog-RSN-1 जारी किया, एक ऑडियो-नेटिव संवाद मॉडल

PolyAI ने Dialog-RSN-1 का परिचय दिया है, जो एक संवाद मॉडल है जो प्रतिलिपियों पर निर्भर करने के बजाय सीधे कालकर्ता के ऑडियो को प्रोसेस करता है। यह टर्न-टेकिंग, स्पीच रिकग्निशन, फंक्शन कॉलिंग और रिस्पॉन्स जनरेशन को एक ही ऑडियो-अवेयर सिस्टम में फ्यूज करता है।

media MarkTechPost · 25 दिन पहले · 2 बार देखा गया

अलीबाबा की टोंगी लैब ने फ्लैश और प्लस स्तरों में Qwen-Audio-3.0-TTS जारी किया

अलीबाबा की टोंगी लैब ने Qwen-Audio-3.0-TTS जारी किया है, जो एक होस्टेड टेक्स्ट-टू-स्पीच सिस्टम है जो दो वेरिएंट में उपलब्ध है: रियल-टाइम इंटरैक्शन के लिए फ्लैश और हाई-क्वालिटी जनरेशन के लिए प्लस। दोनों स्तर अलीबाबा क्लाउड मॉडल स्टूडियो के माध्यम से डिलीवर किए जाते हैं, डाउनलोडेबल वेट्स के रूप में नहीं।

media Hugging Face Forums · 29 दिन पहले · 1 बार देखा गया

NymphTech AI रेडियो नेटवर्क के लिए अत्याधुनिक आवाज़ क्लोनिंग की तलाश में

NymphTech अपनी AI रेडियो स्टेशन नेटवर्क को बेहतर बनाने के लिए उच्च-स्तरीय आवाज़ क्लोनिंग और स्पीच सिंथेसिस मॉडल के सुझाव खोज रहा है, विशेष रूप से कई भाषाओं और लंबे प्रारूप की प्रसारण को लक्षित करते हुए। कंपनी ने पहले ही Trinity और Mark जैसे स्थिर AI व्यक्तित्वों वाली एक प्लेटफ़ॉर्म लॉन्च कर दी है, जिसमें Trinity 9 जून से लगातार प्रसारण कर रहा है।