أطلقت NVIDIA نموذج NemotronLabs VoiceChat 11B، وهو نموذج مفتوح المصدر يتكون من 11 مليار معامل لتحويل الكلام إلى كلام بشكل متكامل، ومصمم للمحادثات في الوقت الفعلي وبكامل الاتجاه. وعلى عكس السلاسل المتسلسلة التي تربط بين نماذج التعرف على الكلام (ASR)، والنماذج اللغوية الكبيرة (LLM)، وتوليف الكلام (TTS)، يقوم هذا الشبكة الموحدة بفهم الكلام وتوليده بشكل متدفق في آن واحد، محققةً زمن تبديل أدوار سلساً مقاساً يبلغ 448 مللي ثانية على معيار Full-Duplex-Bench 1.0.

  • يجمع الهيكل بين مشفر Fast Conformer، ونواة النموذج اللغوي الكبير Nemotron Nano v2، ومُترجم كلام NVIDIA TTS، وتم تدريبه على حوالي 550 ألف ساعة من الصوت.
  • يدعم استدعاء الأدوات المباشرة عبر قناة إخراج منفصلة لبرامج <TOOLCALL>، مما يسمح للمشغلين بتعريف رسائل "في الانتظار" لمنع الصمت غير المرغوب فيه أثناء استدعاءات واجهة برمجة التطبيقات (API).
  • يتيح النموذج للمستخدمين مقاطعة المحادثة في منتصفها بمعدل استلام يبلغ 1.00 عند 480 مللي ثانية، ويتصدر المرتبة الثانية بين النماذج المفتوحة بكامل الاتجاه على معيار VoiceBench.
  • الأوزاء متاحة بموجب رخصة OpenMDW-1.1 المسمحة، لكن NVIDIA تصنف نقطة التفتيش بأنها جاهزة لأغراض البحث فقط بسبب عيوب معروفة مثل حدود سقف السياق.
  • يتطلب النشر بطاقة رسومات واحدة (GPU) بسعة ذاكرة فيديو لا تقل عن 80 جيجابايت، مثل A100 أو H100، ولا توجد حالياً واجهة برمجة تطبيقات (API) مستضافة.

يوفر هذا الإصدار خياراً قابلاً للنشر للتجارب في مراكز الاتصال، ومساعدات السيارات، وأدوات إمكانية الوصول، رغم أنه لا يُوصى به بعد للاستخدام في الإنتاج.