Voice & audio
github llama.cpp · 5 दिन पहले · 5 बार देखा गया

llama.cpp b10270 ने Qwen3-TTS समर्थन जोड़ा है और llama-tts में ब्रेकिंग बदलाव किए हैं

llama.cpp प्रोजेक्ट ने संस्करण b10270 जारी किया, जिसमें Qwen3-TTS मॉडल के लिए समर्थन पेश किया गया है। इस अपडेट में llama-tts बाइनरी के लिए एक ब्रेकिंग बदलाव शामिल है और नए टेक्स्ट-टू-स्पीच वर्कफ़्लो को संभालने के लिए महत्वपूर्ण आर्किटेक्चरल संशोधन लागू किए गए हैं।

media r/LocalLLaMA · 5 दिन पहले

NVIDIA ने Hugging Face पर NemotronLabs-VoiceChat-11B मॉडल जारी किया

NVIDIA ने Hugging Face पर NemotronLabs-VoiceChat-11B वॉइस चैट मॉडल उपलब्ध कराया है। रिपॉजिटरी को पूर्ण डुप्लेक्स संचार क्षमताओं का समर्थन करने के रूप में वर्णित किया गया है।

lab OpenAI News · 5 दिन पहले · 8 बार देखा गया

OpenAI इंजीनियरों ने GPT-Live बनाया, एक फुल-डप्लेक्स वॉइस सिस्टम जो टर्न डिटेक्टर को हटाता है

OpenAI ने GPT-Live जारी किया है, एक तीसरी पीढ़ी का वॉइस सिस्टम जो एक फुल-डप्लेक्स मॉडल का उपयोग करके पारंपरिक टर्न डिटेक्टर को समाप्त करता है, जो एक साथ सुनने और बोलने में सक्षम है। यह आर्किटेक्चर वास्तविक समय की प्रदर्शन के लिए अनुकूलित नए सिस्टम डिज़ाइन के माध्यम से कम लेटेंसी बनाए रखते हुए अधिक तत्काल और प्राकृतिक संवादों को सक्षम बनाता है।

media Hugging Face Forums · 6 दिन पहले

OpenGauntlet ने 168 TTS और 106 STT प्रणालियों का कैटलॉग प्रकाशित किया

एक शोधकर्ता ने OpenGauntlet शोध कैटलॉग प्रकाशित किया है, जो 168 टेक्स्ट-टू-स्पीच (TTS) प्रणालियों और 106 स्पीच-टू-टेक्स्ट (STT) प्रणालियों के बारे में जानकारी वाला एक सार्वजनिक संसाधन है। डायरेक्ट्रीज़ ओपन और होस्टेड मॉडल्स, लाइसेंसिंग, हार्डवेयर आवश्यकताओं, भाषाओं, क्षमताओं, जीवन चक्र की स्थिति, स्रोत जानकारी और उपलब्ध होने पर प्रकाशित बेंचमार्क डेटा को कवर करती हैं।

media MarkTechPost · 9 दिन पहले · 1 बार देखा गया

PolyAI ने Dialog-RSN-1 जारी किया, एक ऑडियो-नेटिव संवाद मॉडल

PolyAI ने Dialog-RSN-1 का परिचय दिया है, जो एक संवाद मॉडल है जो प्रतिलिपियों पर निर्भर करने के बजाय सीधे कालकर्ता के ऑडियो को प्रोसेस करता है। यह टर्न-टेकिंग, स्पीच रिकग्निशन, फंक्शन कॉलिंग और रिस्पॉन्स जनरेशन को एक ही ऑडियो-अवेयर सिस्टम में फ्यूज करता है।

lab xAI News · 11 दिन पहले · 10 बार देखा गया

xAI ने Grok Voice Think Fast 2.0 जारी किया, जिसमें सुधारी गई वक्त्व तर्कशक्ति और प्रतिलिपिकरण सटीकता है

xAI ने Grok Voice Think Fast 2.0 की घोषणा की, जो एक अगली पीढ़ी का speech-to-speech voice मॉडल है जिसे बुद्धिमत्ता, प्रतिलिपिकरण सटीकता और संवादात्मक क्षमताओं को बढ़ाने के लिए डिज़ाइन किया गया है। यह अपडेट अपने पूर्ववर्ती पर निर्माण करता हुआ speech reasoning, संवादात्मक क्षमता और tool use विश्वसनीयता में महत्वपूर्ण लाभ पेश करता है।

lab Google DeepMind Blog · 11 दिन पहले · 5 बार देखा गया

Google ने Flow Music में संगीतमयता और वोकल्स में उन्नति के साथ Lyria 3.5 लॉन्च किया

Google ने Google Flow Music के भीतर अपने नवीनतम संगीत जनरेशन मॉडल, Lyria 3.5 को लॉन्च किया है ताकि उपयोगकर्ताओं को अधिक रचनात्मक नियंत्रण के साथ समृद्ध ट्रैक बनाने में मदद मिल सके।

media MarkTechPost · 19 दिन पहले · 1 बार देखा गया

अलीबाबा की टोंगी लैब ने फ्लैश और प्लस स्तरों में Qwen-Audio-3.0-TTS जारी किया

अलीबाबा की टोंगी लैब ने Qwen-Audio-3.0-TTS जारी किया है, जो एक होस्टेड टेक्स्ट-टू-स्पीच सिस्टम है जो दो वेरिएंट में उपलब्ध है: रियल-टाइम इंटरैक्शन के लिए फ्लैश और हाई-क्वालिटी जनरेशन के लिए प्लस। दोनों स्तर अलीबाबा क्लाउड मॉडल स्टूडियो के माध्यम से डिलीवर किए जाते हैं, डाउनलोडेबल वेट्स के रूप में नहीं।

media The Batch · 23 दिन पहले GPQA Diamond · 84.2% · 3 बार देखा गया

OpenAI ने फुल-डप्लेक्स वॉइस मॉडल्स जारी किए और जर्मन अदालत ने Google को AI ओवरव्यू के लिए जिम्मेदार ठहराया

OpenAI ने पुनर्निर्मित ChatGPT Voice को संचालित करने के लिए GPT-Live-1 और GPT-Live-1 mini लॉन्च किए हैं, जो समानात्र सुनने और बोलने की अनुमति देने वाले फुल-डप्लेक्स ऑडियो प्रोसेसिंग को पेश करते हैं। सिस्टम जटिल क्वेरीज़ को GPT-5.5 जैसे बैकग्राउंड रीजनिंग मॉडल्स को सौंपता है, जिससे गहरी सोच चलते हुए निरंतर संवाद संभव होता है।

media Hugging Face Forums · 23 दिन पहले

NymphTech AI रेडियो नेटवर्क के लिए अत्याधुनिक आवाज़ क्लोनिंग की तलाश में

NymphTech अपनी AI रेडियो स्टेशन नेटवर्क को बेहतर बनाने के लिए उच्च-स्तरीय आवाज़ क्लोनिंग और स्पीच सिंथेसिस मॉडल के सुझाव खोज रहा है, विशेष रूप से कई भाषाओं और लंबे प्रारूप की प्रसारण को लक्षित करते हुए। कंपनी ने पहले ही Trinity और Mark जैसे स्थिर AI व्यक्तित्वों वाली एक प्लेटफ़ॉर्म लॉन्च कर दी है, जिसमें Trinity 9 जून से लगातार प्रसारण कर रहा है।

arxiv arXiv cs.CL · 24 दिन पहले

ऑडियो-अवेयर बड़े भाषा मॉडलों से सूक्ष्म-स्तरीय फीडबैक के माध्यम से टेक्स्ट-टू-ऑडियो निर्देश पालन में सुधार

शोधकर्ता एक फ्रेमवर्क का प्रस्ताव करते हैं जो ऑडियो-अवेयर बड़े भाषा मॉडलों (ALLMs) को सूक्ष्म-स्तरीय न्यायाधीश के रूप में उपयोग करता है ताकि उत्पन्न ऑडियो में लक्ष्य घटना की उपस्थिति और कालिक संबंधों की पुष्टि की जा सके। यह दृष्टिकोण उस अंतर को दूर करता है जहां मौजूदा टेक्स्ट-टू-ऑडियो मॉडल अक्सर कई ध्वनि घटनाओं और उनके क्रम से जुड़े निर्देशों का पालन करने में विफल रहते हैं।

arxiv arXiv cs.CL · 24 दिन पहले

बोलचाल के मूल्यांकन के लिए बड़े ऑडियो-भाषा मॉडल जजों में प्रोटोकॉल-स्तरीय शॉर्टकट का ऑडिट

एक अध्ययन ने बोलचाल के मूल्यांकन के लिए स्वचालित जज के रूप में उपयोग किए जाने वाले बड़े ऑडियो-भाषा मॉडलों (LALMs) में प्रोटोकॉल-स्तरीय शॉर्टकट का ऑडिट किया है, यह उजागर करते हुए कि मानव रेटिंग्स के साथ उच्च सहमति इस बात की गारंटी नहीं देती कि निर्णय वास्तविक ऑडियो पर आधारित हैं। शोध छह जजों और चार विशेषताओं के बीच तीन तैनाती प्रोटोकॉल का जांच करता है: फीचर-ब्लूप्रिंट जजिंग, रेफरेंस-कंडीशंड जजिंग और पेयरवाइज़ A/B तुलना।

arxiv arXiv cs.CL · 24 दिन पहले

WavLM पर DTW ध्वनिविज्ञान, लय और स्वरारोह के लिए पाठ-मुक्त L2 उच्चारण मूल्यांकन सक्षम बनाता है

अध्ययन अंग्रेजी और जापानी L2 उच्चारण में ध्वनिविज्ञान की सटीकता, लय और स्वरारोह का आकलन करने के लिए स्व-सुपरव्यूड WavLM निरूपण पर गतिशील समय विकर्षण (DTW) के उपयोग की जांच करता है, जिसके लिए लेबल किए गए प्रशिक्षण डेटा की आवश्यकता नहीं होती। सीखने वाले के उच्चारण को प्राकृतिक टेम्पलेट से तुलित करने वाला मूल DTW दृष्टिकोण संपूर्ण और वाक्य-स्तर के ध्वनिविज्ञान मूल्यांकन में मानव सहमति से अधिक है।

media r/LocalLLaMA · 25 दिन पहले

Audient LLM ऑडियो धारणा में बढ़ते अवधारणा मेमोरी को जोड़ता है

ओपन-सोर्स फ्रेमवर्क Audient LLM एजेंट्स के लिए एक स्थानीय ऑडियो धारणा परत प्रदान करता है जो लगातार ध्वनि को प्रोसेस करता है और उपयोग के माध्यम से अवधारणाओं की मेमोरी बनाता है। यह निरंतर LLM कॉल की आवश्यकता के बिना ऑडियो इवेंट्स को गेट, फिंगरप्रिंट और पहचानने के लिए CLAP embeddings, Whisper, Silero VAD और sqlite-vec का उपयोग करता है।

arxiv arXiv cs.AI · 25 दिन पहले · 1 बार देखा गया

फ्रोजन डिस्क्रीट-डिफ्यूजन लैंग्वेज मॉडल के साथ ऑडियो-नेटिव स्पीच रिकग्निशन

शोधकर्ताओं ने दिखाया है कि एक डिस्क्रीट डिफ्यूजन लैंग्वेज मॉडल पूरे ट्रांसक्रिप्ट को समानांतर में कुछ ही डीनोइजिंग चरणों में परिष्कृत करके स्पीच को ट्रांसक्राइब कर सकता है, न कि ऑटोरेग्रेसिव डिकोडर्स का उपयोग करके।

lab Hugging Face Blog · 25 दिन पहले · 14 बार देखा गया

Hume ने मानव आवाज़ AI की गुणवत्ता के लिए Real World VoiceEQ बेंचमार्क जारी किया

Hume ने Real World VoiceEQ पेश किया है, एक बेंचमार्क जो प्रणालियों ट्रांसक्रिप्ट के परे ध्वनि जानकारी को कितनी अच्छी तरह पहचानती और उत्पन्न करती हैं, इसका आकलन करके आवाज़ इंटरैक्शन की मानव गुणवत्ता का मूल्यांकन करने के लिए डिज़ाइन किया गया है। बेंचमार्क 785,000 TTS और 48,000 STS मानव रेटिंग्स से व्युत्पन्न 60 से अधिक मेट्रिक्स का उपयोग करके 15+ आयामों में 40 से अधिक प्रोप्राइटरी और ओपन-सोर्स मॉडल्स का मूल्यांकन करता है।

media r/LocalLLaMA · 25 दिन पहले · 3 बार देखा गया

audio.cpp 0.3 में Supertonic 3, MOSS-TTS, IndexTTS2 और Irodori-TTS GGUF सपोर्ट के साथ जोड़े गए

audio.cpp प्रोजेक्ट ने संस्करण 0.3 जारी किया है, जिसमें पाँच नए टेक्स्ट-टू-स्पिच मॉडल शामिल हैं: Supertonic 3, MOSS-TTS-Local, MOSS-TTS-Nano, IndexTTS2 और Irodori-TTS। अपडेट में GGUF सपोर्ट भी जोड़ा गया है, जिसे मॉडल के अनुसार लागू किया जाएगा।

arxiv arXiv cs.CL · 25 दिन पहले

एकीकृत ग्रेडिएंट प्रक्षेपण बहुभाषी ASR में विनाशक भूल को कम करता है

शोधकर्ताओं ने एकीकृत ग्रेडिएंट प्रक्षेपण (UGP) का प्रस्ताव रखा है, जो कम संसाधन वाली भाषाओं पर व्हिस्पर जैसे बड़े पूर्व-प्रशिक्षित ASR मॉडलों को फाइन-ट्यून करते समय विनाशक भूल को कम करने के लिए एक विधि है। UGP एक एकीकृत प्रक्षेपण स्थान में भाषा-संतुलित पुन: उत्पादन से संदर्भ ग्रेडिएंट का उपयोग करके पैरामीटर अपडेट को बाधित करता है, जिससे प्रति-भाषा योगदानों को प्रभावी ढंग से बराबर किया जाता है और प्रमुख भाषा के पक्षपात को कम किया जाता है।

media r/LocalLLaMA · 26 दिन पहले

Cicero किसी भी ACP एजेंट के लिए स्व-होस्टेड द्विदिक्कीय आवाज़ को सक्षम बनाता है

लेखक Cicero का परिचय देते हैं, जो AI एजेंट्स के लिए स्व-होस्टेड, द्विदिक्कीय आवाज़ इंटरैक्शन प्रदान करने वाला एक ओपन-सोर्स प्रोजेक्ट है। वन-वे डिक्टेशन टूल्स के विपरीत, Cicero एजेंट्स को Telegram के जरिए बोलने और उपयोगकर्ताओं को कॉल करने की अनुमति देता है, सभी ऑडियो को स्थानीय रूप से रखते हुए।

media Hugging Face Forums · 27 दिन पहले

डेवलपर प्रोडक्शन वॉइस AI एजेंट्स के लिए ऑर्केस्ट्रेशन पैटर्न की खोज कर रहा है

Hugging Face फोरम पर एक डेवलपर यह समझने का प्रयास कर रहा है कि Bland.ai, Retell और Vapi जैसे प्रोडक्शन प्लेटफ़ॉर्म विशाल, हैंड-राइटन सिस्टम प्रॉम्प्ट्स पर निर्भर किए बिना प्रॉम्प्ट ऑर्केस्ट्रेशन को कैसे प्रबंधित करते हैं। लेखक FastAPI, Sarvam STT/TTS और Pipecat SmartTurn V3 का उपयोग करके अपनी वर्तमान कार्यान्वयन का वर्णन करता है, यह नोट करते हुए कि मैन्युअल स्टेट-वाइज इंजेक्शन बढ़ती जटिलता और एज-केस विफलताओं की ओर ले जाता है।