Voice & audio
arxiv arXiv cs.CL · منذ 2 يوم · 13 مشاهدة

NemotronLabs تطلق VoiceChat، نموذج مفتوح المصدر للتحويل من الكلام إلى كلام مع استدعاء الأدوات

أعلنت NemotronLabs عن إطلاق VoiceChat، وهو نموذج مفتوح الأوزان للتحويل من الكلام إلى كلام يعمل بنظام الاتصال الكامل (full-duplex)، مصمم لدمج الاستماع، والنسخ، والاستدلال، والتحدث ضمن بنية دفق موحدة. يجمع النظام بين مشفر صوتي للدفق ومُفسّر لغة يعتمد على نموذج لغوي فقط (decoder-only) مع تدفقات إخراج متخصصة متوازية للنص الوكيل والمكالمات الدالية المهيكلة، بالإضافة إلى فرع مساعد من نوع RNN-T للنسخ التدريجي للمستخدم.

arxiv arXiv cs.AI · منذ 2 يوم · 13 مشاهدة

NemotronLabs تطلق VoiceChat، نموذج مفتوح المصدر للتحويل من الكلام إلى كلام مع دعم استدعاء الأدوات

أعلنت NemotronLabs عن إطلاق NemotronLabs VoiceChat، وهو نموذج مفتوح الأوزان للتحويل من الكلام إلى كلام يعمل بنظام الاتصال الكامل (full-duplex)، يدمج قدرات استدعاء الأدوات بشكل أصيل ضمن بنية تدفق موحدة. يجمع النظام بين مشفر كلام متدفق ونموذج لغوي يعتمد على فك التشفير فقط، مع تدفقات إخراج متوازية لنص الوكيل والمكالمات الدالية المهيكلة، بالإضافة إلى فرع RNN-T مساعد للنسخ التدريجي ومُشفر TTS متدفق.

media MarkTechPost · منذ 4 يوم · 14 مشاهدة

SpaceXAI تطلق واجهة برمجة تطبيقات Grok Voice Transcribe 2.0 بدّقة مُزعومة تبلغ ضعف السابق

أطلقت SpaceXAI نموذج Grok Voice Transcribe 2.0، وهو نموذج لتحويل الكلام إلى نص متاح عبر واجهة برمجة تطبيقات مستضافة، يدّعي تحقيق دقة أعلى بمرتين مقارنةً بالإصدار 1.0 عند نفس نقطة السعر. يستهدف النموذج ظروف الصوت الصعبة مثل خطوط الهاتف المشوشة والأصوات المتداخلة، ويعمل في كل من وضعي المعالجة الدفعي والبث المباشر.

lab xAI News · منذ 5 يوم · 24 مشاهدة

xAI تطلق Grok Voice Transcribe 2.0 بدقة ضعف v1

أطلقت xAI نموذج Grok Voice Transcribe 2.0، وهو نموذج لتحويل الكلام إلى نص يكون أكثر دقة مرتين من الإصدار 1.0 مع الحفاظ على نفس السعر. مبني على النموذج الأساسي للصوت وراء Grok Voice، يستفيد من مجموعة بيانات فريدة من الصوت متعدد اللغات المباشر والمليء بالضوضاء للتعامل مع ظروف العالم الحقيقي الصعبة مثل خطوط الهاتف غير المستمرة والأصوات المتنافسة.

lab Google — The Keyword (AI) · منذ 8 يوم · 23 مشاهدة

جوجل توسّع الذكاء الاصطناعي متعدد اللغات عبر جيميناي 3.5، وبيانات مفتوحة المصدر، والترجمة دون اتصال

تُفيد جوجل بأن تقنياتها تدعم الآن أكثر من 300 لغة لأكثر من 7 مليارات شخص، وتُطلق أدوات جديدة لتحسين فهم الكلام، وجمع البيانات للغة الممثلة تمثيلاً ناقصاً، وإمكانية الوصول.

lab OpenAI News · منذ 13 يوم τ²-bench · 1.0% · 52 مشاهدة

OpenAI تُطلق واجهة برمجة تطبيقات GPT-Live-1 لتجارب صوتية طبيعية

أطلقت OpenAI نموذج GPT-Live-1 في واجهة برمجة التطبيقات، مما يوفر للمطورين نموذجاً واحداً قادراً على الاستماع والتحدث في وقت واحد لبناء تطبيقات مدعومة بالصوت. تهدف هذه الإصدار إلى تبسيط تطوير طبقة الصوت من خلال استبدال البنى المتسلسلة التقليدية بنهج موحد يتعامل مع المقاطعات والسياق بشكل أكثر طبيعية.

media Hugging Face Forums · منذ 13 يوم · 14 مشاهدة

مطور يبحث عن نصائح لتصميم بنية ذكاء اصطناعي صوتي فعالة من حيث التكلفة مع زمن استجابة للرمز الأول يقارب 500 مللي ثانية

يسأل مطور ذكاء اصطناعي عن نصائح معمارية لبناء نظام ذكاء اصطناعي صوتي في الوقت الفعلي يحقق زمن استجابة للرمز الأول حوالي 500 مللي ثانية أو أقل، مع الحفاظ على الفعالية من حيث التكلفة والقابلية للتوسع.

media Hugging Face Forums · منذ 13 يوم · 12 مشاهدة

ايدن يقترح تقسيم الصوت في الوقت الفعلي وتنفيذ المهام إلى نماذج منفصلة

يصف ايدن بنية للوكلاء تتطلب محادثة صوتية كاملة التوجيه (full-duplex) جنبًا إلى جنب مع الاستدلال البصري المعقد وإجراءات الجهاز، متجنبًا قيود نموذج واحد يعالج الاثنين. تقسم الحل المسؤوليات: يدير نموذج الصوت في الوقت الفعلي المحادثة بينما يقوم نموذج منفصل وأقوى بتنفيذ المهام الخلفية، بالتنسيق غير المتزامن عبر طابور المهام.

media Hugging Face Forums · منذ 14 يوم · 14 مشاهدة

يقدم F-0310 استنتاجًا محليًا مستقلًا لـ XTTS-v2 و Qwen 2.5 على نظام ويندوز

يُمكن غلاف نشر جديد بدون تبعيات يُدعى F-0310 من إجراء الاستنتاج المحلي الكامل وغير المتصل عبر الإنترنت لـ Coqui XTTS-v2 و Qwen 2.5 على نظام ويندوز دون الحاجة إلى واجهات برمجة تطبيقات سحابية.

media MarkTechPost · منذ 14 يوم · 21 مشاهدة

جراديوم تطلق Voice Design لتوليد أصوات اصطناعية من نصوص وصفية

أطلقت شركة جراديوم، المتخصصة في الذكاء الاصطناعي للصوت ومقرها باريس، ميزة Voice Design التي تولد أصواتًا اصطناعية جديدة من أوصاف مكتوبة دون الحاجة إلى ملفات صوتية مرجعية. أصبحت الأداة متاحة الآن عبر واجهة برمجة التطبيقات (API) واستوديو جراديوم بخمس لغات.

arxiv arXiv cs.LG · منذ 14 يوم · 24 مشاهدة

تمكّن TontaubeV1 من تحويل النص إلى كلام بالتدفق مع سياق محدود

يقدم الباحثون نموذج TontaubeV1 لتحويل النص إلى كلام يحافظ على الإيقاع الطبيعي مع تمكين الاستدلال بالتدفق من خلال بطاقة رسوميات استهلاكية واحدة. يستخدم النظام تمثيل DualCodec الهرمي بمعدل 12.5 هرتز لفصل التدفقات الدلالية عن التحسينات الصوتية، مما يتيح توليدًا منخفض التأخير.

arxiv arXiv cs.CL · منذ 14 يوم · 25 مشاهدة

تمكّن TontaubeV1 من البث المباشر لنص إلى كلام مع سياق محدود

يقدم الباحثون نموذج TontaubeV1، وهو نموذج لتحويل النص إلى كلام يحافظ على الإيقاع الطبيعي مع تمكين الاستدلال المتدفق من بطاقة رسومات استهلاكية واحدة. يستخدم النظام تمثيل DualCodec هرمي بمعدل 12.5 هرتز لفصل التدفقات الدلالية عن التحسينات الصوتية، مما يسمح بالفك التسببي رغم الطبيعة غير التسببية للترميز الأساسي.

lab Tencent Hunyuan (HF) · منذ 14 يوم · 24 مشاهدة

تيانتسنت تطلق نموذج توليد الكلام AuK-Flash مفتوح المصدر والمضغوط بـ 1.5 مليار معلمة

أعلنت تيانتسنت عن إتاحة نموذج الأساس AuK لتوليد الكلام وتحريره كمصدر مفتوح، بما في ذلك الكود والأوزان على منصتي Hugging Face وModelScope. يتضمن الإصدار متغير AuK-Flash المضغوط المصمم للاستدلال السريع بخطوات فقط 4.

media MarkTechPost · منذ 21 يوم · 26 مشاهدة

مختبرات الذكاء الفائق من ميتا تطلق موس فايس ترانسبرايب

أطلقت مختبرات الذكاء الفائق من ميتا (Meta Superintelligence Labs) أداة موس فايس ترانسبرايب، وهي نموذج أحادي ذاتي الانحدار يؤدي التعرف التلقائي على الكلام البثّي (ASR)، وتصنيف المتحدثين لأكثر من 20 متحدثاً، وتحديد نقاط النهاية في عملية واحدة. يتوفر النموذج كواجهة برمجة تطبيقات مستضافة على واجهة ميتا للبرمجيات للنماذج تحت الاسم muse-voice-transcribe-1.0.