الموضوع · Voice & audio
lab Google DeepMind Blog · منذ 7 يوم · 28 مشاهدة

جوجل تقدم نماذج تحويل النص إلى كلام من عائلة جيمياني 3.8 فلاش وفلاش-لايت

أطلقت جوجل نموذجين جديدين لتحويل النص إلى كلام، هما جيمياني 3.8 فلاش TTS وجيمياني 3.8 فلاش-لايت TTS، مما يوسع عائلة جيمياني أودييو ليوفر قدرات توليد صوت ديناميكية للمبدعين والمطورين والشركات.

lab xAI News · منذ 12 يوم · 30 مشاهدة

xAI تطلق Grok Voice Transcribe 2.0 بدقة ضعف v1

أطلقت xAI نموذج Grok Voice Transcribe 2.0، وهو نموذج لتحويل الكلام إلى نص يكون أكثر دقة مرتين من الإصدار 1.0 مع الحفاظ على نفس السعر. مبني على النموذج الأساسي للصوت وراء Grok Voice، يستفيد من مجموعة بيانات فريدة من الصوت متعدد اللغات المباشر والمليء بالضوضاء للتعامل مع ظروف العالم الحقيقي الصعبة مثل خطوط الهاتف غير المستمرة والأصوات المتنافسة.

lab OpenAI News · منذ 20 يوم τ²-bench · 1.0% · 58 مشاهدة

OpenAI تُطلق واجهة برمجة تطبيقات GPT-Live-1 لتجارب صوتية طبيعية

أطلقت OpenAI نموذج GPT-Live-1 في واجهة برمجة التطبيقات، مما يوفر للمطورين نموذجاً واحداً قادراً على الاستماع والتحدث في وقت واحد لبناء تطبيقات مدعومة بالصوت. تهدف هذه الإصدار إلى تبسيط تطوير طبقة الصوت من خلال استبدال البنى المتسلسلة التقليدية بنهج موحد يتعامل مع المقاطعات والسياق بشكل أكثر طبيعية.

lab Google — The Keyword (AI) · منذ 15 يوم · 27 مشاهدة

جوجل توسّع الذكاء الاصطناعي متعدد اللغات عبر جيميناي 3.5، وبيانات مفتوحة المصدر، والترجمة دون اتصال

تُفيد جوجل بأن تقنياتها تدعم الآن أكثر من 300 لغة لأكثر من 7 مليارات شخص، وتُطلق أدوات جديدة لتحسين فهم الكلام، وجمع البيانات للغة الممثلة تمثيلاً ناقصاً، وإمكانية الوصول.

lab Hugging Face Blog · منذ 4 ساعة · مشاهدة واحدة

إطلاق لوحة المتصدرين المفتوحة لتقييم أنظمة تحويل النص إلى كلام متعددة اللغات وقابلة للتوسع

تم إصدار لوحة المتصدرين المفتوحة لأنظمة تحويل النص إلى كلام (TTS) لمعالجة التشتت ونقص المعايير في تقييم هذه الأنظمة، وذلك باستخدام مقاييس موضوعية بدلاً من الاعتماد حصرياً على درجات تفضيل البشر البطيئة والمعتمدة على قاعات التصويت. وتقوم بتقييم النماذج من حيث الوضوح والسرعة وتشابه المتحدثين باستخدام نماذج Qwen3 ASR وتضمينات WavLM.

media MarkTechPost · منذ 1 يوم · 3 مشاهدات

ألبابا كوين تطلق نموذج الصوت ثنائي الاتجاه الكامل Qwen-Audio-3.1-Realtime

أطلقت فريق كوين التابع لألبابا مجموعة نماذج صوتية مكونة من خمسة نماذج، تشمل Qwen-Audio-3.1-Realtime-plus الجديد، وهو نموذج كلام ثنائي الاتجاه مصمم لوكلاء الصوت القادرين على الاستدلال واستخدام الأدوات. كما يتضمن الإطلاق تخفيضات في الأسعار تصل إلى 95% على خدمات التعرف التلقائي على الكلام (ASR).

media MarkTechPost · منذ 7 يوم · 5 مشاهدات

جوجل تطلق نماذج Gemini 3.8 Flash TTS وFlash-Lite TTS مع تصميم صوتي قائم على المطالبات

أطلقت جوجل نموذجين جديدين لتحويل النص إلى كلام، هما Gemini 3.8 Flash TTS وGemini 3.8 Flash-Lite TTS، كجزء من عائلة Gemini Audio. تقدم هذه النماذج تصميمًا صوتيًا مولدًا من مطالبات باللغة الطبيعية وتوجيه الأداء سطرًا بسطر عبر Gemini API وGoogle AI Studio.

media MarkTechPost · منذ 7 يوم · 16 مشاهدة

إنفidia تطلق Nemotron 3 Diarization، نموذجًا بـ 100 مليون معلمة لتتبع 8 متحدثين

أطلقت إنفidia نموذج Nemotron 3 Diarization، وهو نموذج مفتوح الأوزان لتصنيف المتحدثين، متاح على Hugging Face بموجب ترخيص OpenMDW الإصدار 1.1. يتعقب النموذج ذو الـ 100 مليون معلمة ما يصل إلى 8 متحدثين متداخلين في الوقت الفعلي أو في الأوضاع غير المتزامنة باستخدام نقطة تفتيش واحدة.

lab Hugging Face Blog · منذ 7 يوم · 27 مشاهدة

إطلاق نفيديا لنموذج تمييز المتحدثين Nemotron 3 ذو الأوزان المفتوحة

أطلقت شركة نفيديا نموذج Nemotron 3 Diarization، وهو نموذج مفتوح الأوزان يحتوي على 100 مليون معامل، مصمم لتمييز المتحدثين في الوقت الفعلي ويدعم ما يصل إلى ثمانية متحدثين. يحتل النموذج المرتبة الأولى على لوحة المتصدرين لـ VoiceArena's Diarization-Bench بمعدل خطأ تمييز (DER) يبلغ 14.72٪، متفوقًا على النظام التالي بنسبة تخفيض نسبية تقارب 24٪.

arxiv arXiv cs.CL · منذ 10 يوم · 17 مشاهدة

NemotronLabs تطلق VoiceChat، نموذج مفتوح المصدر للتحويل من الكلام إلى كلام مع استدعاء الأدوات

أعلنت NemotronLabs عن إطلاق VoiceChat، وهو نموذج مفتوح الأوزان للتحويل من الكلام إلى كلام يعمل بنظام الاتصال الكامل (full-duplex)، مصمم لدمج الاستماع، والنسخ، والاستدلال، والتحدث ضمن بنية دفق موحدة. يجمع النظام بين مشفر صوتي للدفق ومُفسّر لغة يعتمد على نموذج لغوي فقط (decoder-only) مع تدفقات إخراج متخصصة متوازية للنص الوكيل والمكالمات الدالية المهيكلة، بالإضافة إلى فرع مساعد من نوع RNN-T للنسخ التدريجي للمستخدم.

arxiv arXiv cs.AI · منذ 10 يوم · 17 مشاهدة

NemotronLabs تطلق VoiceChat، نموذج مفتوح المصدر للتحويل من الكلام إلى كلام مع دعم استدعاء الأدوات

أعلنت NemotronLabs عن إطلاق NemotronLabs VoiceChat، وهو نموذج مفتوح الأوزان للتحويل من الكلام إلى كلام يعمل بنظام الاتصال الكامل (full-duplex)، يدمج قدرات استدعاء الأدوات بشكل أصيل ضمن بنية تدفق موحدة. يجمع النظام بين مشفر كلام متدفق ونموذج لغوي يعتمد على فك التشفير فقط، مع تدفقات إخراج متوازية لنص الوكيل والمكالمات الدالية المهيكلة، بالإضافة إلى فرع RNN-T مساعد للنسخ التدريجي ومُشفر TTS متدفق.

media MarkTechPost · منذ 12 يوم · 16 مشاهدة

SpaceXAI تطلق واجهة برمجة تطبيقات Grok Voice Transcribe 2.0 بدّقة مُزعومة تبلغ ضعف السابق

أطلقت SpaceXAI نموذج Grok Voice Transcribe 2.0، وهو نموذج لتحويل الكلام إلى نص متاح عبر واجهة برمجة تطبيقات مستضافة، يدّعي تحقيق دقة أعلى بمرتين مقارنةً بالإصدار 1.0 عند نفس نقطة السعر. يستهدف النموذج ظروف الصوت الصعبة مثل خطوط الهاتف المشوشة والأصوات المتداخلة، ويعمل في كل من وضعي المعالجة الدفعي والبث المباشر.

media Hugging Face Forums · منذ 20 يوم · 14 مشاهدة

مطور يبحث عن نصائح لتصميم بنية ذكاء اصطناعي صوتي فعالة من حيث التكلفة مع زمن استجابة للرمز الأول يقارب 500 مللي ثانية

يسأل مطور ذكاء اصطناعي عن نصائح معمارية لبناء نظام ذكاء اصطناعي صوتي في الوقت الفعلي يحقق زمن استجابة للرمز الأول حوالي 500 مللي ثانية أو أقل، مع الحفاظ على الفعالية من حيث التكلفة والقابلية للتوسع.

media Hugging Face Forums · منذ 21 يوم · 15 مشاهدة

ايدن يقترح تقسيم الصوت في الوقت الفعلي وتنفيذ المهام إلى نماذج منفصلة

يصف ايدن بنية للوكلاء تتطلب محادثة صوتية كاملة التوجيه (full-duplex) جنبًا إلى جنب مع الاستدلال البصري المعقد وإجراءات الجهاز، متجنبًا قيود نموذج واحد يعالج الاثنين. تقسم الحل المسؤوليات: يدير نموذج الصوت في الوقت الفعلي المحادثة بينما يقوم نموذج منفصل وأقوى بتنفيذ المهام الخلفية، بالتنسيق غير المتزامن عبر طابور المهام.