Voice & audio
lab OpenAI News · منذ 5 يوم · 8 مشاهدات

مهندسو OpenAI يُطلقون GPT-Live، نظام صوتي ثنائي الاتجاه يزيل كاشفات تبادل الأدوار

أطلقت OpenAI نظام GPT-Live، وهو الجيل الثالث من الأنظمة الصوتية الذي يلغي كاشف تبادل الأدوار التقليدي باستخدام نموذج ثنائي الاتجاه قادر على الاستماع والتحدث في وقت واحد. يسمح هذا التصميم بمحادثات أكثر فورية وطبيعية مع الحفاظ على زمن انتقال منخفض من خلال تصميم نظام جديد مُحسّن للأداء في الوقت الفعلي.

media Hugging Face Forums · منذ 6 يوم

OpenGauntlet ينشر كتالوجًا يحتوي على 168 نظام TTS و106 نظام STT

نشر باحث كتالوج أبحاث OpenGauntlet، وهو مورد عام يحتوي على معلومات حول 168 نظامًا لتحويل النص إلى كلام (TTS) و106 أنظمة لتحويل الكلام إلى نص (STT). تغطي الدلائل النماذج مفتوحة المصدر والمُستضافة، والتراخيص، ومتطلبات الأجهزة، واللغات، والقدرات، وحالة دورة الحياة، ومعلومات المصدر، وبيانات المعايير المنشورة حيثما كانت متاحة.

media MarkTechPost · منذ 9 يوم · مشاهدة واحدة

PolyAI تطلق Dialog-RSN-1، نموذج محادثة أصلي للصوت

أطلقت PolyAI نموذج Dialog-RSN-1، وهو نموذج محدد للمحادثة يعالج الصوت الخام للمتصل مباشرةً بدلاً من الاعتماد على النصوص. يدمج تبادل الأدوار، التعرف على الكلام، استدعاء الوظائف، وتوليد الردود في نظام واحد واعٍ للصوت.

lab xAI News · منذ 11 يوم · 10 مشاهدات

xAI تطلق Grok Voice Think Fast 2.0 بدقة محسّنة في الاستدلال الصوتي والنسخ

أعلنت xAI عن إطلاق Grok Voice Think Fast 2.0، وهو نموذج صوتي من الجيل التالي لتحويل الكلام إلى كلام صُمم لتعزيز الذكاء ودقة النسخ والقدرات الحوارية. يبني هذا التحديث على سلفه بإدخال مكاسب ملموسة في الاستدلال الصوتي والقدرة الحوارية وموثوقية استخدام الأدوات.

media MarkTechPost · منذ 19 يوم · مشاهدة واحدة

مختبر تونغوي التابع لشركة علي بابا يُطلق Qwen-Audio-3.0-TTS بطبقتي فلاش وبلاس

أطلق مختبر تونغوي التابع لشركة علي بابا نظام Qwen-Audio-3.0-TTS، وهو نظام مستضاف لتحويل النص إلى كلام، متوفر بنسختين: فلاش للتفاعل في الوقت الفعلي، وبلاس للجيل عالي الجودة. يتم تقديم كلتا الطبقتين عبر منصة Alibaba Cloud Model Studio بدلاً من أوزان قابلة للتنزيل.

media The Batch · منذ 23 يوم GPQA Diamond · 84.2% · 3 مشاهدات

OpenAI تطلق نماذج صوتية ثنائية الاتجاه ومحكمة ألمانية تحاسب جوجل على ملخصات الذكاء الاصطناعي

أطلقت OpenAI نموذجي GPT-Live-1 وGPT-Live-1 mini لتشغيل نسخة مُعاد بناؤها من ChatGPT Voice، مقدمةً معالجة صوتية ثنائية الاتجاه تتيح الاستماع والتحدث في وقت واحد. يعهد النظام المهام المعقدة إلى نماذج استدلال خلفية مثل GPT-5.5، مما يتيح محادثة مستمرة بينما يحدث تفكير أعمق.

media Hugging Face Forums · منذ 23 يوم

NymphTech تبحث عن أحدث تقنيات استنساخ الصوت لشبكة الراديو بالذكاء الاصطناعي

تبحث NymphTech عن توصيات لنماذج استنساخ الصوت وتوليف الكلام عالية المستوى لتعزيز شبكتها من محطات الراديو بالذكاء الاصطناعي، مع التركيز بشكل خاص على عدة لغات والبث طويل المدى. أطلقت الشركة بالفعل منصة تتميز بشخصيات ذكاء اصطناعي مستمرة مثل Trinity وMark، حيث تبث Trinity باستمرار منذ 9 يونيو.

arxiv arXiv cs.CL · منذ 24 يوم

تحسين اتباع التعليمات من النص إلى الصوت عبر تغذية راجعة دقيقة من نماذج لغوية كبيرة واعية للصوت

يقترح الباحثون إطار عمل يستخدم النماذج اللغوية الكبيرة الواعية للصوت (ALLMs) كحكمين دقيقين للتحقق من وجود الأحداث المستهدفة والعلاقات الزمنية في الصوت المُولّد. يعالج هذا النهج الفجوة حيث تفشل نماذج النص إلى الصوت الحالية غالبًا في اتباع التعليمات التي تتضمن أحداث صوتية متعددة وترتيبها.

arxiv arXiv cs.CL · منذ 24 يوم

مراجعة الاختصارات على مستوى البروتوكول في قضاة نماذج اللغة الصوتية الكبيرة لتقييم الكلام

تقوم دراسة بمراجعة الاختصارات على مستوى البروتوكول في النماذج اللغوية الصوتية الكبيرة (LALMs) المستخدمة كحكم تلقائي لتقييم الكلام، وكشفت أن الاتفاق العالي مع التقييمات البشرية لا يضمن أن الأحكام مبنية على الصوت الفعلي. تفحص البحث ثلاثة بروتوكولات نشر: حكم المخطط المميز، وحكم المشروط بالإشارة المرجعية، ومقارنة A/B الزوجية عبر ستة قضاة وأربعة سمات.

arxiv arXiv cs.CL · منذ 24 يوم

تمكين تقييم نطق اللغة الثانية بدون نص للphonetics والإيقاع والنبرة باستخدام DTW على WavLM

تبحث الدراسة في استخدام الالتواء الزمني الديناميكي (DTW) على تمثيلات WavLM ذاتية الإشراف لتقييم الدقة الصوتية، والإيقاع، والنبرة في نطق اللغة الثانية بالإنجليزية واليابانية دون الحاجة إلى بيانات تدريب مُعلَّمة. يتجاوز نهج DTW الأساسي الذي يقارن نطق المتعلمين بالقوالب الأصلية اتفاق البشر في التقييم الصوتي الشامل وعلى مستوى الجملة.

media r/LocalLLaMA · منذ 25 يوم

تضيف Audient ذاكرة مفاهيم متنامية لإدراك الصوت في نماذج LLM

يوفر إطار العمل مفتوح المصدر Audient طبقة إدراك صوت محلي لوكلاء LLM يعالجون الصوت باستمرار ويبنون ذاكرة للمفاهيم من خلال الاستخدام. يستخدم تضمينات CLAP وWhisper وSilero VAD وsqlite-vec لتصفية وبصمة وتعرف على أحداث الصوت دون الحاجة إلى مكالمات LLM مستمرة.

arxiv arXiv cs.AI · منذ 25 يوم · مشاهدة واحدة

التعرف على الكلام الأصلي للصوت باستخدام نموذج لغة للانتشار المنفصل المجمد

يُظهر الباحثون أن نموذج لغة للانتشار المنفصل يمكنه نسخ الكلام خطياً عن طريق تحسين النص الكامل بالتوازي خلال عدد قليل من خطوات إزالة الضوضاء، بدلاً من استخدام فكوك التنبؤ الذاتي.

lab Hugging Face Blog · منذ 25 يوم · 14 مشاهدة

Hume تطلق معيار Real World VoiceEQ لجودة الصوت البشري في الذكاء الاصطناعي

أطلقت Hume معيار Real World VoiceEQ، وهو معيار مصمم لتقييم جودة التفاعل الصوتي البشري من خلال تقييم مدى قدرة الأنظمة على التعرف على المعلومات الصوتية وإنتاجها بما يتجاوز النصوص المكتوبة. يقيّم المعيار أكثر من 40 نموذجًا خاصًا ومفتوح المصدر عبر أكثر من 15 بُعدًا باستخدام أكثر من 60 مقياسًا مشتقًا من 785,000 تقييم بشري لـ TTS و48,000 تقييم لـ STS.

arxiv arXiv cs.CL · منذ 25 يوم

البروز المتدرج الموحد يقلل من النسيان الكارثي في التعرف على الكلام متعدد اللغات

يقترح الباحثون البروز المتدرج الموحد (UGP)، وهي طريقة لتخفيف النسيان الكارثي عند ضبط نماذج ASR المدربة مسبقاً الكبيرة مثل Whisper على لغات ذات موارد منخفضة. يقيّد UGP تحديثات المعلمات باستخدام متدرجات مرجعية من إعادة التشغيل المتوازن بين اللغات ضمن فضاء بروز موحد، مما يساهم بشكل فعال في مساواة المساهمات لكل لغة ويقلل من تحيز اللغة المهيمنة.

media r/LocalLLaMA · منذ 26 يوم

يتيح Cicero الصوت ثنائي الاتجاه المستضاف ذاتياً لأي وكيل ACP

يقدم المؤلف مشروع Cicero، وهو مشروع مفتوح المصدر يوفر تفاعلاً صوتياً ثنائي الاتجاه ومستضافاً ذاتياً لوكلاء الذكاء الاصطناعي. على عكس أدوات الإملاء أحادية الاتجاه، يسمح Cicero للوكلاء بالتحدث مرة أخرى والاتصال بالمستخدمين عبر Telegram، مع الحفاظ على جميع البيانات الصوتية محلياً.

media Hugging Face Forums · منذ 27 يوم

مطور يستكشف أنماط التنسيق لوكلاء الذكاء الاصطناعي الصوتي في الإنتاج

يسعى مطور على منتديات Hugging Face لفهم كيفية إدارة منصات الإنتاج مثل Bland.ai وRetell وVapi لتنسيق الأوامر (prompts) دون الاعتماد على أوامر نظام ضخمة مكتوبة يدوياً. يصف المؤلف تنفيذهم الحالي باستخدام FastAPI وSarvam STT/TTS وPipecat SmartTurn V3، مشيراً إلى أن الحقن اليدوي القائم على الحالة يؤدي إلى تعقيد متزايد وفشل في الحالات الحدية.