Voice & audio
arxiv arXiv cs.CL · 2 दिन पहले · 13 बार देखा गया

NemotronLabs ने VoiceChat जारी किया, जो टूल कॉलिंग के साथ एक खुला पूर्ण-द्विदिशीय स्पीच-टू-स्पीच मॉडल है

NemotronLabs ने VoiceChat का परिचय दिया, जो एक खुले वजन वाला पूर्ण-द्विदिशीय स्पीच-टू-स्पीच मॉडल है जिसे एक एकीकृत स्ट्रीमिंग आर्किटेक्चर के भीतर सुनने, ट्रांसक्रिप्शन, तर्क और बोलने को एकीकृत करने के लिए डिज़ाइन किया गया है। सिस्टम में एक स्ट्रीमिंग स्पीच एन्कोडर और डिकोडर-केवल भाषा मॉडल का संयोजन शामिल है, जिसमें एजेंट टेक्स्ट और संरचित फ़ंक्शन कॉल्स के लिए समानांतर विशेष आउटपुट स्ट्रीम्स हैं, साथ ही एक सहायक RNN-T शाखा है जो क्रमिक उपयोगकर्ता ट्रांसक्रिप्शन के लिए है।

arxiv arXiv cs.AI · 2 दिन पहले · 13 बार देखा गया

NemotronLabs ने VoiceChat जारी किया, एक खुला पूर्ण-डुप्लेक्स स्पीच-टू-स्पीच मॉडल जिसमें टूल कॉलिंग है

NemotronLabs ने NemotronLabs VoiceChat का परिचय दिया, जो एक ओपन-वेट पूर्ण-डुप्लेक्स स्पीच-टू-स्पीच मॉडल है जो एक एकीकृत स्ट्रीमिंग आर्किटेक्चर के भीतर नेटिव टूल-कॉलिंग क्षमताओं को एकीकृत करता है। सिस्टम एक स्ट्रीमिंग स्पीच एनकोडर और डिकोडर-केवल भाषा मॉडल को एजेंट टेक्स्ट और संरचित फंक्शन कॉल्स के लिए समानांतर आउटपुट स्ट्रीम्स, अतिरिक्त RNN-T ब्रांच जो क्रमिक ट्रांसक्रिप्शन के लिए है और एक स्ट्रीमिंग TTS डिकोडर के साथ जोड़ता है।

media MarkTechPost · 4 दिन पहले · 14 बार देखा गया

SpaceXAI ने दावे के साथ 2x सटीकता वाला Grok Voice Transcribe 2.0 API जारी किया

SpaceXAI ने Grok Voice Transcribe 2.0 जारी किया है, जो एक स्पीच-टू-टेक्स्ट मॉडल है और होस्टेड API के माध्यम से उपलब्ध है, जिसका दावा है कि इसकी सटीकता संस्करण 1.0 की तुलना में दोगुनी है, समान मूल्य बिंदु पर। मॉडल शोर भरे फोन लाइनों और प्रतिस्पर्धी आवाज़ों जैसे कठिन ऑडियो परिस्थितियों को लक्षित करता है, जो बैच और रियल-टाइम स्ट्रीमिंग दोनों मोड में चलता है।

lab xAI News · 5 दिन पहले · 24 बार देखा गया

xAI ने v1 की तुलना में दोगुनी सटीकता के साथ Grok Voice Transcribe 2.0 जारी किया

xAI ने Grok Voice Transcribe 2.0 जारी किया है, जो एक स्पीच-टू-टेक्स्ट मॉडल है और वजन 1.0 की तुलना में दोगुना सटीक है जबकि समान मूल्य बनाए हुए है। यह Grok Voice के पीछे वाले ऑडियो फाउंडेशन मॉडल पर निर्मित है, जो चुनौतीपूर्ण वास्तविक दुनिया की स्थितियों जैसे कि अस्थिर फोन लाइनों और प्रतिस्पर्धी आवाज़ों को संभालने के लिए लाइव, शोर वाले बहुभाषी ऑडियो के एक अनूठे डेटासेट का लाभ उठाता है।

media MarkTechPost · 7 दिन पहले · 23 बार देखा गया

Google ने उत्पादन वॉइस एजेंट्स के लिए Gemini 3.8 Live और Extended Thinking जारी किया

Google ने Gemini 3.8 Live और Gemini 3.8 Live Extended Thinking पेश किए हैं, जो वास्तविक समय के वॉइस एजेंट्स के लिए डिज़ाइन किए गए नेटिव स्पीच-टू-स्पीच मॉडल हैं, जो संवाद की प्रवाह को बिना तोड़े तर्क करते हैं और टूल्स का निष्पादन करते हैं।

lab Google — The Keyword (AI) · 8 दिन पहले · 23 बार देखा गया

गूगल ने जेमिनी 3.5, ओपन डेटासेट और ऑफ़लाइन अनुवाद के साथ बहुभाषी एआई का विस्तार किया

गूगल ने बताया कि अब उसकी तकनीकें 7 अरब से अधिक लोगों के लिए 300 से अधिक भाषाओं का समर्थन करती हैं, और उच्चारण समझ, कम प्रतिनिधित्व वाली भाषाओं के लिए डेटा संग्रह और सुलभता में सुधार करने के लिए नए उपकरण पेश किए गए हैं।

lab OpenAI News · 13 दिन पहले τ²-bench · 1.0% · 52 बार देखा गया

OpenAI ने प्राकृतिक आवाज़ अनुभवों के लिए GPT-Live-1 API लॉन्च किया

OpenAI ने API में GPT-Live-1 लॉन्च किया है, जो डेवलपर्स को एक ऐसा मॉडल प्रदान करता है जो एक साथ सुनने और बोलने की क्षमता रखता है ताकि वे आवाज़ से संचालित ऐप्स बना सकें। यह रिलीज पारंपरिक चेन्ड आर्किटेक्चर को एक एकीकृत दृष्टिकोण से बदलकर, जो विघटनों और संदर्भ को अधिक प्राकृतिक ढंग से संभालता है, आवाज़ परत विकास को सरल बनाने का लक्ष्य रखती है।

media Hugging Face Forums · 13 दिन पहले · 14 बार देखा गया

डेवलपर ~500ms के पहले-टोकन विलंबता के साथ लागत-प्रभावी वॉइस AI आर्किटेक्चर डिज़ाइन करने पर सलाह मांगता है

एक AI डेवलपर लगभग 500 ms या उससे कम पहले-टोकन विलंबता प्राप्त करते हुए लागत-प्रभावी और स्केलेबल रहने वाले एक रियल-टाइम वॉइस AI सिस्टम बनाने के लिए आर्किटेक्चर सलाह मांग रहा है।

media Hugging Face Forums · 13 दिन पहले · 12 बार देखा गया

Aiden वास्तविक समय में आवाज़ और कार्य निष्पादन को अलग-अलग मॉडलों में विभाजित करने का प्रस्ताव देता है

Aiden एजेंट्स के लिए एक आर्किटेक्चर का वर्णन करता है जिसमें जटिल दृश्य तर्क और डिवाइस कार्यों के साथ पूर्ण-डुप्लेक्स आवाज़ संवाद की आवश्यकता होती है, दोनों को संभालने वाले एकल मॉडल की सीमा से बचते हुए। समाधान जिम्मेदारियों को विभाजित करता है: एक वास्तविक समय आवाज़ मॉडल संवाद का प्रबंधन करता है जबकि एक अलग, शक्तिशाली मॉडल पृष्ठभूमि कार्यों को निष्पादित करता है, कार्य कतार के माध्यम से असिंक्रोनस रूप से समन्वयित।

media Hugging Face Forums · 14 दिन पहले · 17 बार देखा गया

F-0310 Windows पर XTTS-v2 और Qwen 2.5 के लिए स्टैंडअलोन लोकल इन्फरेंस प्रदान करता है

एक उपयोगकर्ता ने F-0310 जारी किया है, जो एक शून्य-निर्भरता वाला व्रैपर है जो Windows पर Coqui XTTS-v2 और Qwen 2.5 की पूरी तरह से लोकल डिप्लॉयमेंट को क्लाउड APIs की आवश्यकता के बिना सक्षम बनाता है।

media Hugging Face Forums · 14 दिन पहले · 14 बार देखा गया

F-0310 विंडोज़ पर XTTS-v2 और Qwen 2.5 के लिए स्टैंडअलोन लोकल इनफरेंस प्रदान करता है

एक नया शून्य-निर्भरता डिप्लॉयमेंट व्रैपर जिसका नाम F-0310 है, विंडोज़ पर Coqui XTTS-v2 और Qwen 2.5 के लिए पूर्णतः लोकल, ऑफलाइन इनफरेंस को सक्षम बनाता है बिना क्लाउड API की आवश्यकता के।

media MarkTechPost · 14 दिन पहले · 21 बार देखा गया

ग्रैडियम ने टेक्स्ट प्रॉम्प्ट से सिंथेटिक आवाज़ें उत्पन्न करने के लिए वॉइस डिज़ाइन लॉन्च किया

पेरिस स्थित वॉइस एआई कंपनी ग्रैडियम ने वॉइस डिज़ाइन लॉन्च किया है, जो संदर्भ ऑडियो की आवश्यकता के बिना लिखित विवरणों से नई सिंथेटिक आवाज़ें उत्पन्न करने वाला एक फीचर है। यह टूल अब ग्रैडियम एपीआई और स्टूडियो में पाँच भाषाओं में उपलब्ध है।

arxiv arXiv cs.LG · 14 दिन पहले · 24 बार देखा गया

TontaubeV1 सीमित संदर्भ के साथ स्ट्रीमिंग टेक्स्ट-टू-स्पीच को सक्षम बनाता है

शोधकर्ताओं ने TontaubeV1 प्रस्तुत किया, जो एक प्राकृतिक ध्वनिछटा (prosody) को बनाए रखने वाला टेक्स्ट-टू-स्पीच मॉडल है और एक ही उपभोक्ता GPU से स्ट्रीमिंग इनफरेंस को सक्षम बनाता है। सिस्टम 12.5 Hz पर हियरार्किकल DualCodec प्रतिनिधित्व का उपयोग करता है ताकि अर्थपूर्ण धाराओं (semantic streams) को एकाउस्टिक रिफाइनमेंट्स से अलग किया जा सके, जिससे कम लेटेन्सी जनरेशन संभव होता है।

arxiv arXiv cs.CL · 14 दिन पहले · 25 बार देखा गया

TontaubeV1 सीमित संदर्भ के साथ स्ट्रीमिंग टेक्स्ट-टू-स्पीच को सक्षम बनाता है

शोधकर्ताओं ने TontaubeV1 प्रस्तुत किया, एक टेक्स्ट-टू-स्पीच मॉडल जो प्राकृतिक प्रसोडी को बनाए रखते हुए एकल उपभोक्ता GPU से स्ट्रीमिंग इनफरेंस को सक्षम बनाता है। सिस्टम अंतर्निहित कोडेक की नॉनकेजुअल प्रकृति के बावजूद कैजुअल डिकोडिंग की अनुमति देकर, सेमांटिक स्ट्रीम्स को एकोस्टिक रिफाइनमेंट्स से अलग करने के लिए 12.5 Hz पर एक हियरार्किकल DualCodec प्रतिनिधित्व का उपयोग करता है।

arxiv arXiv cs.CL · 14 दिन पहले · 18 बार देखा गया

AuK तकनीकी रिपोर्ट: वक्ता उत्पादन और संपादन के लिए एक ओपन-सोर्स मौलिक मॉडल

AuC तकनीकी रिपोर्ट एक ओपन-सोर्स मौलिक मॉडल का परिचय देती है जो प्राकृतिक-भाषा निर्देशों और ऑडियो संदर्भ के माध्यम से वक्ता उत्पादन और संपादन को एकीकृत करता है।

lab Tencent Hunyuan (HF) · 14 दिन पहले · 27 बार देखा गया

Tencent ने स्पीच जनरेशन और एडिटिंग के लिए ओपन-सोर्स AuK फाउंडेशन मॉडल जारी किया

Tencent ने स्पीच जनरेशन और एडिटिंग के लिए अपने AuK 1.5B फाउंडेशन मॉडल को कोड और मॉडल वेट्स सहित ओपन-सोफ्टवेयर के रूप में उपलब्ध कराया है।

lab Tencent Hunyuan (HF) · 14 दिन पहले · 24 बार देखा गया

टेंसेंट ने ओपन-सोर्स AuK-Flash जारी किया, जो 1.5B का एक संपीडित वॉइस जनरेशन मॉडल है

टेंसेंट ने स्पीच जनरेशन और एडिटिंग के लिए AuK फाउंडेशन मॉडल को ओपन सोर्स के रूप में उपलब्ध कराया है, जिसमें Hugging Face और ModelScope पर कोड और वेट्स शामिल हैं। रिलीज़ में AuK-Flash शामिल है, जो तेज़ इनफरेंस के लिए डिज़ाइन किया गया एक संपीडित (distilled) वेरिएंट है जिसमें केवल 4 स्टेप्स हैं।

media MarkTechPost · 21 दिन पहले · 26 बार देखा गया

मेटा सुपरइंटेलिजेंस लैब्स ने म्यूज़ वॉयस ट्रांसक्राइब जारी किया

मेटा सुपरइंटेलिजेंस लैब्स ने म्यूज़ वॉयस ट्रांसक्राइब जारी किया है, जो एकल ऑटोरेग्रेसिव मॉडल है जो स्ट्रीमिंग ऑटोमैटिक स्पेच रिकग्निशन (ASR), 20+ बोलने वालों के लिए स्पीकर डायरिज़ेशन और एंडपॉइंटिंग को एक ही पास में करता है। मॉडल मेटा मॉडल API पर 'muse-voice-transcribe-1.0' नाम से होस्टेड API के रूप में उपलब्ध है।

media r/LocalLLaMA · 23 दिन पहले · 29 बार देखा गया

pipecat-ai ने GPT 5.6 Terra प्रदर्शन के साथ phonellm-alpha-1 जारी किया

pipecat-ai परियोजना ने phonellm-alpha-1 मॉडल जारी किया है, जो सामान्य वॉइस एजेंट कार्यों पर GPT 5.6 के तुलनीय प्रदर्शन प्राप्त करता है।