أعلنت NemotronLabs عن إطلاق VoiceChat، وهو نموذج مفتوح الأوزان للتحويل من الكلام إلى كلام يعمل بنظام الاتصال الكامل (full-duplex)، مصمم لدمج الاستماع، والنسخ، والاستدلال، والتحدث ضمن بنية دفق موحدة. يجمع النظام بين مشفر صوتي للدفق ومُفسّر لغة يعتمد على نموذج لغوي فقط (decoder-only) مع تدفقات إخراج متخصصة متوازية للنص الوكيل والمكالمات الدالية المهيكلة، بالإضافة إلى فرع مساعد من نوع RNN-T للنسخ التدريجي للمستخدم.

  • على Full-Duplex-Bench 1.0، يحقق النموذج أدنى معدلات الاستيلاء على التعامل مع الفترات بين الجمل مقارنةً بالأنظمة مفتوحة الأوزان التي خضعت للتقييم، مع استيلاء بنسبة 100% بعد مقاطعات المستخدم، ودرجة جودة رد ما بعد المقاطعة تبلغ 4.33 من 5.
  • يعيد النموذج الردود بعد إشارات الاستماع الخلفية من المستخدم في 93% من الحالات على Full-Duplex-Bench 1.5.
  • يحصل النموذج على متوسط طبيعي قدره 55.1 على VoiceBench، ويحقق دقة F1 بنسبة 82.5% لاختيار الأدوات على Full-Duplex-Bench 3.0، رغم أن دقة الحجج وتنفيذ الأدوات من البداية إلى النهاية يتطلبان تحسينًا.

تُظهر هذه النتائج أنه يمكن دمج التفاعل ثنائي الاتجاه، والتعرف على الكلام وتوليده، والقدرات اللغوية العامة، واستخدام الأدوات الخارجية في نموذج واحد مفتوح المصدر دون التضحية بسلوك المحادثة في الوقت الفعلي.