أطلقت NVIDIA نموذج الدردشة الصوتية NemotronLabs-VoiceChat-11B على Hugging Face. يُوصف المستوداع بأنه يدعم قدرات الاتصال ثنائي الاتجاه الكامل.
إطلاق NVIDIA لنموذج NemotronLabs-VoiceChat-11B على Hugging Face
إطلاق نفيديا لنموذج تمييز المتحدثين Nemotron 3 ذو الأوزان المفتوحة
أطلقت شركة نفيديا نموذج Nemotron 3 Diarization، وهو نموذج مفتوح الأوزان يحتوي على 100 مليون معامل، مصمم لتمييز المتحدثين في الوقت الفعلي ويدعم ما يصل إلى ثمانية متحدثين. يحتل النموذج المرتبة الأولى على لوحة المتصدرين لـ VoiceArena's Diarization-Bench بمعدل خطأ تمييز (DER) يبلغ 14.72٪، متفوقًا على النظام التالي بنسبة تخفيض نسبية تقارب 24٪.
إضافة Magpie TTS من NVIDIA للعربية والكورية والبرتغالية وتحسين الجودة
أطلقت NVIDIA تحديثًا لنموذجها متعدد اللغات Magpie Multilingual TTS، حيث توسع الدعم ليشمل اثني عشر لغة بإضافة العربية الفصحى الحديثة والكورية والبرتغالية البرازيلية. يتضمن التحديث أيضًا تحسينات في الجودة عبر اللغات الحالية من خلال بيانات تدريب محدثة وتغييرات معمارية.
إطلاق NVIDIA لـ NemotronLabs VoiceChat 11B، نموذج مفتوح المصدر للتحويل من الكلام إلى كلام بكامل الاتجاه مع تبديل أدوار يستغرق حوالي 450 مللي ثانية
أطلقت NVIDIA نموذج NemotronLabs VoiceChat 11B، وهو نموذج مفتوح المصدر يتكون من 11 مليار معامل لتحويل الكلام إلى كلام بشكل متكامل، ومصمم للمحادثات في الوقت الفعلي وبكامل الاتجاه. وعلى عكس السلاسل المتسلسلة التي تربط بين نماذج التعرف على الكلام (ASR)، والنماذج اللغوية الكبيرة (LLM)، وتوليف الكلام (TTS)، يقوم هذا الشبكة الموحدة بفهم الكلام وتوليده بشكل متدفق في آن واحد، محققةً زمن تبديل أدوار سلساً مقاساً يبلغ 448 مللي ثانية على معيار Full-Duplex-Bench 1.0.
إنفيديا تطلق نموذج اللغات الكبيرة الموحد للصوت والنص Nemotron-Labs-Audex-30B-A3B
أطلقت إنفيديا (Nvidia) نموذج اللغات الكبيرة الموحد للصوت والنص Nemotron-Labs-Audex-30B-A3B، والذي بُني على الهيكل العظمي لـ MoE الخاص بالنصوص فقط Nemotron-Cascade-2-30B-A3B. يوسع النموذج البنية الأصلية بإضافة مشفر صوتي للإدخال ورموز صوت منفصلة للمخرجات، مما يمكّن من قدرات في التعرف على الكلام، والترجمة، وتحويل النص إلى كلام، وتوليد الصوت.
NemotronLabs تطلق VoiceChat، نموذج مفتوح المصدر للتحويل من الكلام إلى كلام مع استدعاء الأدوات
أعلنت NemotronLabs عن إطلاق VoiceChat، وهو نموذج مفتوح الأوزان للتحويل من الكلام إلى كلام يعمل بنظام الاتصال الكامل (full-duplex)، مصمم لدمج الاستماع، والنسخ، والاستدلال، والتحدث ضمن بنية دفق موحدة. يجمع النظام بين مشفر صوتي للدفق ومُفسّر لغة يعتمد على نموذج لغوي فقط (decoder-only) مع تدفقات إخراج متخصصة متوازية للنص الوكيل والمكالمات الدالية المهيكلة، بالإضافة إلى فرع مساعد من نوع RNN-T للنسخ التدريجي للمستخدم.