लैब · ByteDance
media MarkTechPost · 5 दिन पहले · 3 बार देखा गया

बाइटडेंस सीड ने सीडरियलटाइम पेश किया, एक नैटिव ऑडियो-विजुअल फुल-डप्लेक्स LLM

बाइटडेंस की सीड टीम ने सीडरियलटाइम का परिचय दिया है, जो एक नैटिव ऑडियो-विजुअल फुल-डप्लेक्स लार्ज लैंग्वेज मॉडल है जो ऑडियो, वीडियो और टेक्स्ट को एक एकीकृत आर्किटेक्चर में जोड़ता है। पारंपरिक ASR, VLM और TTS मॉड्यूल के कैस्केडेड स्टैक्स के विपरीत, सीडरियलटाइम निरंतर बहु-मोडल स्ट्रीम्स पर वास्तविक समय की अंतःक्रिया को सक्षम बनाने के लिए धारणा, समझ, निर्णय और अभिव्यक्ति को समानांतर में चलाता है।

media r/LocalLLaMA · 5 दिन पहले · 9 बार देखा गया

ByteDance AI विलयन से बचने और अपने तरीके से नए मॉडल विकसित करने का वादा करता है

ByteDance ने अपनी अगली पीढ़ी के AI मॉडल को AI विलयन तकनीकों पर निर्भर किए बिना विकसित करने की प्रतिबद्धता का ऐलान किया है।

media r/LocalLLaMA · 5 दिन पहले · 9 बार देखा गया

MiniMax ने ओपन-वेट H3 वीडियो जनरेशन मॉडल को नेटिव स्टीरियो ऑडियो के साथ जारी किया

MiniMax ने Hugging Face पर ओपन-वेट H3 ओमनी-मोडल वीडियो जनरेशन मॉडल जारी किया, जिसमें नेटिव स्टीरियो ऑडियो है जो एक फॉरवर्ड पास में वीडियो को चला सकता है। मॉडल 5 से 15 सेकंड तक के क्लिप्स के लिए 2K रिज़ॉल्यूशन और 24fps का समर्थन करता है और प्रति जनरेशन नौ रेफरेंस इमेज, तीन वीडियो और तीन ऑडियो क्लिप स्वीकार करता है।

arxiv arXiv cs.CL · 11 दिन पहले · 4 बार देखा गया

डौइयां ने शीर्ष प्रदर्शन वाले DME बहु-मोडल एम्बेडिंग मॉडल को जारी किया

डौइयां ने अपने मल्टीमोडल एम्बेडिंग (DME) मॉडल के लिए तकनीकी रिपोर्ट जारी की है, जो शक्तिशाली विभेदन और दक्षता प्राप्त करने के लिए बड़े पैमाने पर कंट्रास्टिव प्री-ट्रेनिंग को लेटेन्ट रीजनिंग के साथ जोड़ता है।