يحقق NOVA-VAD، وهو كاشف نشاط صوتي خفيف الوزن وقابل للتفسير، دقة بنسبة 93% على الصوت الضاخم من مجموعة بيانات UrbanSound8K، متفوقًا على WebRTC (58%) وPyannote (62%) وSilero (87%). يستخدم فقط scikit-learn، ولا يتطلب GPU، ويوفر أهمية الميزات ودرجات الثقة باللغة الإنجليزية البسيطة.
NOVA-VAD يتفوق على Silero وPyannote وWebRTC في الصوت الضاخم بدقة 93%
إضافة Magpie TTS من NVIDIA للعربية والكورية والبرتغالية وتحسين الجودة
أطلقت NVIDIA تحديثًا لنموذجها متعدد اللغات Magpie Multilingual TTS، حيث توسع الدعم ليشمل اثني عشر لغة بإضافة العربية الفصحى الحديثة والكورية والبرتغالية البرازيلية. يتضمن التحديث أيضًا تحسينات في الجودة عبر اللغات الحالية من خلال بيانات تدريب محدثة وتغييرات معمارية.
إطلاق NVIDIA لـ NemotronLabs VoiceChat 11B، نموذج مفتوح المصدر للتحويل من الكلام إلى كلام بكامل الاتجاه مع تبديل أدوار يستغرق حوالي 450 مللي ثانية
أطلقت NVIDIA نموذج NemotronLabs VoiceChat 11B، وهو نموذج مفتوح المصدر يتكون من 11 مليار معامل لتحويل الكلام إلى كلام بشكل متكامل، ومصمم للمحادثات في الوقت الفعلي وبكامل الاتجاه. وعلى عكس السلاسل المتسلسلة التي تربط بين نماذج التعرف على الكلام (ASR)، والنماذج اللغوية الكبيرة (LLM)، وتوليف الكلام (TTS)، يقوم هذا الشبكة الموحدة بفهم الكلام وتوليده بشكل متدفق في آن واحد، محققةً زمن تبديل أدوار سلساً مقاساً يبلغ 448 مللي ثانية على معيار Full-Duplex-Bench 1.0.
إطلاق NVIDIA لنموذج NemotronLabs-VoiceChat-11B على Hugging Face
أطلقت NVIDIA نموذج الدردشة الصوتية NemotronLabs-VoiceChat-11B على Hugging Face. يُوصف المستوداع بأنه يدعم قدرات الاتصال ثنائي الاتجاه الكامل.
إطلاق Freya-TTS لنموذج تحويل النص إلى كلام تركي بدون موحد رموز بمعدل خطأ كلمة 8.0%
يقدم الباحثون نموذج Freya-TTS، وهو نموذج تحويل نص إلى كلام (TTS) مضغوط وخالي من موحدات الرموز (tokenizers)، ومُحسّن للغة التركية، حيث يحقق معدل خطأ كلمة (WER) بنسبة 8.0% على معيار Freya-TR-Eval. يعمل محوّل الانتشار Diffusion Transformer ذو المطابقة التدفقية الشرطية غير الذاتية المتسلسلة، والذي يحتوي على 183.2 مليون معلمة، في الفضاء الكامن المستمر المُجمّد لـ AudioVAE2، مما يتيح إعادة بناء بجودة عالية بتردد 48 kHz دون الحاجة إلى مُحوّل صوتي (phonemizer) أو موحد رموز كلام منفصل.
OpenMOSS تطلق MOSS-Transcribe-Diarize بحجم 0.9 مليار معلمة للنسخ والتعرف على المتحدثين معاً
أطلقت OpenMOSS نموذج MOSS-Transcribe-Diarize، وهو نموذج لفهم الصوت من البداية إلى النهاية يحتوي على 0.9 مليار معلمة، مصمم للنسخ طويل المدى لمتحدثين متعددين، والتعرف على المتحدثين (Diarization)، والطوابع الزمنية، والوعي بالأحداث الصوتية.