الموضوع · Voice & audio
lab OpenAI News · منذ 11 يوم · 15 مشاهدة

مهندسو OpenAI يُطلقون GPT-Live، نظام صوتي ثنائي الاتجاه يزيل كاشفات تبادل الأدوار

أطلقت OpenAI نظام GPT-Live، وهو الجيل الثالث من الأنظمة الصوتية الذي يلغي كاشف تبادل الأدوار التقليدي باستخدام نموذج ثنائي الاتجاه قادر على الاستماع والتحدث في وقت واحد. يسمح هذا التصميم بمحادثات أكثر فورية وطبيعية مع الحفاظ على زمن انتقال منخفض من خلال تصميم نظام جديد مُحسّن للأداء في الوقت الفعلي.

lab xAI News · منذ 16 يوم · 28 مشاهدة

xAI تطلق Grok Voice Think Fast 2.0 بدقة محسّنة في الاستدلال الصوتي والنسخ

أعلنت xAI عن إطلاق Grok Voice Think Fast 2.0، وهو نموذج صوتي من الجيل التالي لتحويل الكلام إلى كلام صُمم لتعزيز الذكاء ودقة النسخ والقدرات الحوارية. يبني هذا التحديث على سلفه بإدخال مكاسب ملموسة في الاستدلال الصوتي والقدرة الحوارية وموثوقية استخدام الأدوات.

media The Batch · منذ 28 يوم GPQA Diamond · 84.2% · 4 مشاهدات

OpenAI تطلق نماذج صوتية ثنائية الاتجاه ومحكمة ألمانية تحاسب جوجل على ملخصات الذكاء الاصطناعي

أطلقت OpenAI نموذجي GPT-Live-1 وGPT-Live-1 mini لتشغيل نسخة مُعاد بناؤها من ChatGPT Voice، مقدمةً معالجة صوتية ثنائية الاتجاه تتيح الاستماع والتحدث في وقت واحد. يعهد النظام المهام المعقدة إلى نماذج استدلال خلفية مثل GPT-5.5، مما يتيح محادثة مستمرة بينما يحدث تفكير أعمق.

lab Hugging Face Blog · منذ 4 يوم · 8 مشاهدات

إضافة Magpie TTS من NVIDIA للعربية والكورية والبرتغالية وتحسين الجودة

أطلقت NVIDIA تحديثًا لنموذجها متعدد اللغات Magpie Multilingual TTS، حيث توسع الدعم ليشمل اثني عشر لغة بإضافة العربية الفصحى الحديثة والكورية والبرتغالية البرازيلية. يتضمن التحديث أيضًا تحسينات في الجودة عبر اللغات الحالية من خلال بيانات تدريب محدثة وتغييرات معمارية.

media MarkTechPost · منذ 5 يوم · 13 مشاهدة

إطلاق NVIDIA لـ NemotronLabs VoiceChat 11B، نموذج مفتوح المصدر للتحويل من الكلام إلى كلام بكامل الاتجاه مع تبديل أدوار يستغرق حوالي 450 مللي ثانية

أطلقت NVIDIA نموذج NemotronLabs VoiceChat 11B، وهو نموذج مفتوح المصدر يتكون من 11 مليار معامل لتحويل الكلام إلى كلام بشكل متكامل، ومصمم للمحادثات في الوقت الفعلي وبكامل الاتجاه. وعلى عكس السلاسل المتسلسلة التي تربط بين نماذج التعرف على الكلام (ASR)، والنماذج اللغوية الكبيرة (LLM)، وتوليف الكلام (TTS)، يقوم هذا الشبكة الموحدة بفهم الكلام وتوليده بشكل متدفق في آن واحد، محققةً زمن تبديل أدوار سلساً مقاساً يبلغ 448 مللي ثانية على معيار Full-Duplex-Bench 1.0.

media Hugging Face Forums · منذ 12 يوم · 8 مشاهدات

OpenGauntlet ينشر كتالوجًا يحتوي على 168 نظام TTS و106 نظام STT

نشر باحث كتالوج أبحاث OpenGauntlet، وهو مورد عام يحتوي على معلومات حول 168 نظامًا لتحويل النص إلى كلام (TTS) و106 أنظمة لتحويل الكلام إلى نص (STT). تغطي الدلائل النماذج مفتوحة المصدر والمُستضافة، والتراخيص، ومتطلبات الأجهزة، واللغات، والقدرات، وحالة دورة الحياة، ومعلومات المصدر، وبيانات المعايير المنشورة حيثما كانت متاحة.

media MarkTechPost · منذ 15 يوم · 18 مشاهدة

PolyAI تطلق Dialog-RSN-1، نموذج محادثة أصلي للصوت

أطلقت PolyAI نموذج Dialog-RSN-1، وهو نموذج محدد للمحادثة يعالج الصوت الخام للمتصل مباشرةً بدلاً من الاعتماد على النصوص. يدمج تبادل الأدوار، التعرف على الكلام، استدعاء الوظائف، وتوليد الردود في نظام واحد واعٍ للصوت.

media MarkTechPost · منذ 25 يوم · مشاهدتان

مختبر تونغوي التابع لشركة علي بابا يُطلق Qwen-Audio-3.0-TTS بطبقتي فلاش وبلاس

أطلق مختبر تونغوي التابع لشركة علي بابا نظام Qwen-Audio-3.0-TTS، وهو نظام مستضاف لتحويل النص إلى كلام، متوفر بنسختين: فلاش للتفاعل في الوقت الفعلي، وبلاس للجيل عالي الجودة. يتم تقديم كلتا الطبقتين عبر منصة Alibaba Cloud Model Studio بدلاً من أوزان قابلة للتنزيل.

media Hugging Face Forums · منذ 29 يوم · مشاهدة واحدة

NymphTech تبحث عن أحدث تقنيات استنساخ الصوت لشبكة الراديو بالذكاء الاصطناعي

تبحث NymphTech عن توصيات لنماذج استنساخ الصوت وتوليف الكلام عالية المستوى لتعزيز شبكتها من محطات الراديو بالذكاء الاصطناعي، مع التركيز بشكل خاص على عدة لغات والبث طويل المدى. أطلقت الشركة بالفعل منصة تتميز بشخصيات ذكاء اصطناعي مستمرة مثل Trinity وMark، حيث تبث Trinity باستمرار منذ 9 يونيو.