विषय · Voice & audio
lab Google DeepMind Blog · 7 दिन पहले · 28 बार देखा गया

गूगल ने जेमिनी 3.8 फ्लैश और फ्लैश-लाइट टेक्स्ट-टू-स्पीच मॉडल पेश किए

गूगल ने दो नए टेक्स्ट-टू-स्पीच मॉडल, जेमिनी 3.8 फ्लैश TTS और जेमिनी 3.8 फ्लैश-लाइट TTS जारी किए हैं, जो निर्माताओं, डेवलपर्स और उद्यमों के लिए गतिशील आवाज़ जनरेशन क्षमताएं प्रदान करने के लिए जेमिनी ऑडियो परिवार का विस्तार करते हैं।

lab xAI News · 12 दिन पहले · 30 बार देखा गया

xAI ने v1 की तुलना में दोगुनी सटीकता के साथ Grok Voice Transcribe 2.0 जारी किया

xAI ने Grok Voice Transcribe 2.0 जारी किया है, जो एक स्पीच-टू-टेक्स्ट मॉडल है और वजन 1.0 की तुलना में दोगुना सटीक है जबकि समान मूल्य बनाए हुए है। यह Grok Voice के पीछे वाले ऑडियो फाउंडेशन मॉडल पर निर्मित है, जो चुनौतीपूर्ण वास्तविक दुनिया की स्थितियों जैसे कि अस्थिर फोन लाइनों और प्रतिस्पर्धी आवाज़ों को संभालने के लिए लाइव, शोर वाले बहुभाषी ऑडियो के एक अनूठे डेटासेट का लाभ उठाता है।

lab OpenAI News · 20 दिन पहले τ²-bench · 1.0% · 58 बार देखा गया

OpenAI ने प्राकृतिक आवाज़ अनुभवों के लिए GPT-Live-1 API लॉन्च किया

OpenAI ने API में GPT-Live-1 लॉन्च किया है, जो डेवलपर्स को एक ऐसा मॉडल प्रदान करता है जो एक साथ सुनने और बोलने की क्षमता रखता है ताकि वे आवाज़ से संचालित ऐप्स बना सकें। यह रिलीज पारंपरिक चेन्ड आर्किटेक्चर को एक एकीकृत दृष्टिकोण से बदलकर, जो विघटनों और संदर्भ को अधिक प्राकृतिक ढंग से संभालता है, आवाज़ परत विकास को सरल बनाने का लक्ष्य रखती है।

lab Google — The Keyword (AI) · 15 दिन पहले · 27 बार देखा गया

गूगल ने जेमिनी 3.5, ओपन डेटासेट और ऑफ़लाइन अनुवाद के साथ बहुभाषी एआई का विस्तार किया

गूगल ने बताया कि अब उसकी तकनीकें 7 अरब से अधिक लोगों के लिए 300 से अधिक भाषाओं का समर्थन करती हैं, और उच्चारण समझ, कम प्रतिनिधित्व वाली भाषाओं के लिए डेटा संग्रह और सुलभता में सुधार करने के लिए नए उपकरण पेश किए गए हैं।

blog Philipp Schmid · 6 दिन पहले · 6 बार देखा गया

Gemini 3.8 Flash TTS आवाज़ प्रतिकृति और डिज़ाइन सक्षम करता है

Google ने Gemini API और AI Studio के माध्यम से Gemini 3.8 Flash TTS और Flash-Lite TTS जारी किया है, जिसने छह भाषाओं में Hume के Voice Design Benchmark और Voice Arena में शीर्ष रैंकिंग हासिल की है।

media MarkTechPost · 15 दिन पहले · 27 बार देखा गया

Google ने उत्पादन वॉइस एजेंट्स के लिए Gemini 3.8 Live और Extended Thinking जारी किया

Google ने Gemini 3.8 Live और Gemini 3.8 Live Extended Thinking पेश किए हैं, जो वास्तविक समय के वॉइस एजेंट्स के लिए डिज़ाइन किए गए नेटिव स्पीच-टू-स्पीच मॉडल हैं, जो संवाद की प्रवाह को बिना तोड़े तर्क करते हैं और टूल्स का निष्पादन करते हैं।

lab Hugging Face Blog · 4 घंटे पहले

ओपन टीटीएस लीडरबोर्ड स्केलेबल मल्टीलिंगुअल टीटीएस इवैल्यूएशन को लांच करता है

टेक्स्ट-टू-स्पीच (TTS) इवैल्यूएशन में विखंडन और मानकीकरण की कमी को दूर करने के लिए ओपन टीटीएस लीडरबोर्ड जारी किया गया है, जो धीमे, एरीना-आधारित मानव प्राथमिकता स्कोर पर निर्भर रहने के बजाय ऑब्जेक्टिव मेट्रिक्स का उपयोग करता है। यह Qwen3 ASR और WavLM एम्बेडिंग्स का उपयोग करके इंटेलिजिबिलिटी, स्पीड और स्पीकर समानता के आधार पर मॉडल का मूल्यांकन करता है।

media MarkTechPost · 1 दिन पहले · 3 बार देखा गया

अलibaba क्वेन ने क्वेन-ऑडियो-3.1-रियलटाइम फुल-डप्लेक्स वॉइस मॉडल जारी किया

अलibaba के क्वेन टीम ने क्वेन-ऑडियो-3.1 जारी किया है, जो एक पांच-मॉडल ऑडियो स्टैक है जिसमें नया क्वेन-ऑडियो-3.1-रियलटाइम-प्लस शामिल है, जो वॉइस एजेंट्स के लिए डिज़ाइन किया गया एक फुल-डप्लेक्स स्पीच मॉडल है जो तर्क और टूल उपयोग की क्षमता रखता है। इस रिलीज़ में ASR सेवाओं पर 95% तक की कीमत में कमी भी शामिल है।

github llama.cpp · 5 दिन पहले · 4 बार देखा गया

llama.cpp b11190 ने LFM2 ऑडियो में mel प्रीप्रोसेसर को ठीक किया

llama.cpp परियोजना ने संस्करण b11190 जारी किया, जिसमें LFM2 ऑडियो मॉडल में उपयोग किए जाने वाले mel प्रीप्रोसेसर के लिए एक सुधार शामिल है। यह बदलाव उन असंगतियों को दूर करता है जो अंग्रेजी के 4.5% और जापानी के 6.5% परीक्षण उच्चारणों के लिए अलग-अलग लालची ट्रांसक्रिप्शन का कारण बन रहे थे।

media MarkTechPost · 7 दिन पहले · 5 बार देखा गया

गूगल ने प्रॉम्प्ट-आधारित वॉइस डिज़ाइन के साथ गेमिनी 3.8 फ्लैश TTS और फ्लैश-लाइट TTS जारी किया

गूगल ने अपने गेमिनी ऑडियो परिवार का हिस्सा होने के रूप में दो नए टेक्सट-टू-स्पिच मॉडल, गेमिनी 3.8 फ्लैश TTS और गेमिनी 3.8 फ्लैश-लाइट TTS जारी किए हैं। इन मॉडल्स ने प्राकृतिक भाषा प्रॉम्प्ट्स से जनरेटिव वॉइस डिज़ाइन और गेमिनी API तथा गूगल AI स्टूडियो के माध्यम से पंक्ति-दर-पंक्ति प्रदर्शन निर्देश पेश किए हैं।

media MarkTechPost · 7 दिन पहले · 16 बार देखा गया

NVIDIA ने 8 वक्ताओं को ट्रैक करने वाले 100M-पैरामीटर मॉडल Nemotron 3 Diarization जारी किया

NVIDIA ने Hugging Face पर OpenMDW License 1.1 के तहत उपलब्ध एक ओपन-वेट स्पीकर डायरिजेशन मॉडल Nemotron 3 Diarization जारी किया है। यह 100M-पैरामीटर वाला मॉडल एकल चेकपॉइंट का उपयोग करके रियल-टाइम या ऑफलाइन मोड में 8 ओवरलैपिंग वक्ताओं को ट्रैक करता है।

blog Simon Willison · 7 दिन पहले · 5 बार देखा गया

Google ने कस्टम वॉइस क्लोनिंग के साथ Gemini 3.8 Flash TTS मॉडल जारी किए

Google ने दो नए टेक्स्ट-टू-स्पीच मॉडल, gemini-3.8-flash-tts और gemini-3.8-flash-lite-tts जारी किए हैं, जिनमें 2,000 से अधिक आवाज़ों की लाइब्रेरी है।

lab Hugging Face Blog · 7 दिन पहले · 27 बार देखा गया

NVIDIA ने ओपन-वेट Nemotron 3 डायरिज़ेशन मॉडल जारी किया

NVIDIA ने रियल-टाइम स्पीकर डायरिज़ेशन के लिए एक ओपन-वेट, 100M-पैरामीटर वाला मॉडल Nemotron 3 Diarization जारी किया है जो आठ स्पीकर्स तक का समर्थन करता है। यह मॉडल VoiceArena के डायरिज़ेशन-बेंच लीडरबोर्ड पर #1 स्थान पर है, जिसमें 14.72% डायरिज़ेशन एरर रेट (DER) है, जो अगले रैंक वाले सिस्टम की तुलना में लगभग 24% सापेक्ष कमी दिखाता है।

arxiv arXiv cs.CL · 10 दिन पहले · 17 बार देखा गया

NemotronLabs ने VoiceChat जारी किया, जो टूल कॉलिंग के साथ एक खुला पूर्ण-द्विदिशीय स्पीच-टू-स्पीच मॉडल है

NemotronLabs ने VoiceChat का परिचय दिया, जो एक खुले वजन वाला पूर्ण-द्विदिशीय स्पीच-टू-स्पीच मॉडल है जिसे एक एकीकृत स्ट्रीमिंग आर्किटेक्चर के भीतर सुनने, ट्रांसक्रिप्शन, तर्क और बोलने को एकीकृत करने के लिए डिज़ाइन किया गया है। सिस्टम में एक स्ट्रीमिंग स्पीच एन्कोडर और डिकोडर-केवल भाषा मॉडल का संयोजन शामिल है, जिसमें एजेंट टेक्स्ट और संरचित फ़ंक्शन कॉल्स के लिए समानांतर विशेष आउटपुट स्ट्रीम्स हैं, साथ ही एक सहायक RNN-T शाखा है जो क्रमिक उपयोगकर्ता ट्रांसक्रिप्शन के लिए है।

arxiv arXiv cs.AI · 10 दिन पहले · 17 बार देखा गया

NemotronLabs ने VoiceChat जारी किया, एक खुला पूर्ण-डुप्लेक्स स्पीच-टू-स्पीच मॉडल जिसमें टूल कॉलिंग है

NemotronLabs ने NemotronLabs VoiceChat का परिचय दिया, जो एक ओपन-वेट पूर्ण-डुप्लेक्स स्पीच-टू-स्पीच मॉडल है जो एक एकीकृत स्ट्रीमिंग आर्किटेक्चर के भीतर नेटिव टूल-कॉलिंग क्षमताओं को एकीकृत करता है। सिस्टम एक स्ट्रीमिंग स्पीच एनकोडर और डिकोडर-केवल भाषा मॉडल को एजेंट टेक्स्ट और संरचित फंक्शन कॉल्स के लिए समानांतर आउटपुट स्ट्रीम्स, अतिरिक्त RNN-T ब्रांच जो क्रमिक ट्रांसक्रिप्शन के लिए है और एक स्ट्रीमिंग TTS डिकोडर के साथ जोड़ता है।

media MarkTechPost · 11 दिन पहले · 16 बार देखा गया

SpaceXAI ने दावे के साथ 2x सटीकता वाला Grok Voice Transcribe 2.0 API जारी किया

SpaceXAI ने Grok Voice Transcribe 2.0 जारी किया है, जो एक स्पीच-टू-टेक्स्ट मॉडल है और होस्टेड API के माध्यम से उपलब्ध है, जिसका दावा है कि इसकी सटीकता संस्करण 1.0 की तुलना में दोगुनी है, समान मूल्य बिंदु पर। मॉडल शोर भरे फोन लाइनों और प्रतिस्पर्धी आवाज़ों जैसे कठिन ऑडियो परिस्थितियों को लक्षित करता है, जो बैच और रियल-टाइम स्ट्रीमिंग दोनों मोड में चलता है।

media Hugging Face Forums · 20 दिन पहले · 14 बार देखा गया

डेवलपर ~500ms के पहले-टोकन विलंबता के साथ लागत-प्रभावी वॉइस AI आर्किटेक्चर डिज़ाइन करने पर सलाह मांगता है

एक AI डेवलपर लगभग 500 ms या उससे कम पहले-टोकन विलंबता प्राप्त करते हुए लागत-प्रभावी और स्केलेबल रहने वाले एक रियल-टाइम वॉइस AI सिस्टम बनाने के लिए आर्किटेक्चर सलाह मांग रहा है।

media Hugging Face Forums · 21 दिन पहले · 15 बार देखा गया

Aiden वास्तविक समय में आवाज़ और कार्य निष्पादन को अलग-अलग मॉडलों में विभाजित करने का प्रस्ताव देता है

Aiden एजेंट्स के लिए एक आर्किटेक्चर का वर्णन करता है जिसमें जटिल दृश्य तर्क और डिवाइस कार्यों के साथ पूर्ण-डुप्लेक्स आवाज़ संवाद की आवश्यकता होती है, दोनों को संभालने वाले एकल मॉडल की सीमा से बचते हुए। समाधान जिम्मेदारियों को विभाजित करता है: एक वास्तविक समय आवाज़ मॉडल संवाद का प्रबंधन करता है जबकि एक अलग, शक्तिशाली मॉडल पृष्ठभूमि कार्यों को निष्पादित करता है, कार्य कतार के माध्यम से असिंक्रोनस रूप से समन्वयित।

media Hugging Face Forums · 21 दिन पहले · 20 बार देखा गया

F-0310 Windows पर XTTS-v2 और Qwen 2.5 के लिए स्टैंडअलोन लोकल इन्फरेंस प्रदान करता है

एक उपयोगकर्ता ने F-0310 जारी किया है, जो एक शून्य-निर्भरता वाला व्रैपर है जो Windows पर Coqui XTTS-v2 और Qwen 2.5 की पूरी तरह से लोकल डिप्लॉयमेंट को क्लाउड APIs की आवश्यकता के बिना सक्षम बनाता है।