المختبر · ByteDance
media MarkTechPost · منذ 5 يوم · 3 مشاهدات

بايت دانس سيد تطرح SeedRealtime، نموذج لغوي كبير ثنائي الاتجاه أصلي للصوت والمرئيات

أطلق فريق بايت دانس سيد نموذج SeedRealtime، وهو نموذج لغوي كبير أصلي للصوت والمرئيات يعمل بنظام ثنائي الاتجاه، يدمج الصوت والفيديو والنص في بنية موحدة واحدة. وعلى عكس الطبقات المتسلسلة التقليدية لمكونات التعرف على الكلام (ASR)، وفهم الصور (VLM)، وتوليف الكلام (TTS)، يعمل SeedRealtime على الإدراك والفهم واتخاذ القرار والتعبير بالتوازي لتمكين التفاعل في الوقت الفعلي عبر تدفقات متعددة الوسائط بشكل مستمر.

media r/LocalLLaMA · منذ 5 يوم · 9 مشاهدات

مينيماكس تطلق نموذج توليد الفيديو H3 بوزن مفتوح مع صوت ستيريو أصلي

أطلقت مينيماكس نموذج توليد الفيديو الشامل H3 ذو الأوزان المفتوحة على Hugging Face، والذي يتميز بصوت ستيريو أصلي يمكنه تشغيل الفيديو في تمرير أمامي واحد. يدعم النموذج دقة 2K بمعدل 24 إطارًا في الثانية للقطات التي تتراوح مدتها من 5 إلى 15 ثانية ويقبل ما يصل إلى تسع صور مرجعية وثلاثة مقاطع فيديو وثلاثة مقاطع صوتية لكل عملية توليد.