बाइटडेंस की सीड टीम ने सीडरियलटाइम का परिचय दिया है, जो एक नैटिव ऑडियो-विजुअल फुल-डप्लेक्स लार्ज लैंग्वेज मॉडल है जो ऑडियो, वीडियो और टेक्स्ट को एक एकीकृत आर्किटेक्चर में जोड़ता है। पारंपरिक ASR, VLM और TTS मॉड्यूल के कैस्केडेड स्टैक्स के विपरीत, सीडरियलटाइम निरंतर बहु-मोडल स्ट्रीम्स पर वास्तविक समय की अंतःक्रिया को सक्षम बनाने के लिए धारणा, समझ, निर्णय और अभिव्यक्ति को समानांतर में चलाता है।

  • मॉडल बाहरी वॉइस-एक्टिविटी डिटेक्टरों की जगह आंतरिक टर्न-टेकिंग तंत्र से लेता है।
  • यह मोडेलिटीज के बीच पहचान बंधन, निर्देशों को पकड़े रखने से सक्रिय वक्त्व और दृश्य स्थिति के आधार पर सुधार प्रदर्शित करता है।
  • मानवीय मूल्यांकन रिपोर्ट संकेत देती हैं कि गति की समस्याएं कैस्केडेड स्टैक्स की तुलना में आधी रह गईं।
  • सीडरियलटाइम वर्तमान में बाइटडेंस के डुबाओ ऐप के अंदर सक्रिय है, लेकिन इसमें कोई तकनीकी रिपोर्ट, ओपन वेट्स या सार्वजनिक API एंडपॉइंट्स नहीं हैं।

यह रिलीज वास्तविक समय की वॉइस-प्लस-कैमरा उत्पादों के लिए एक मान्य संदर्भ आर्किटेक्चर के रूप में कार्य करती है, तत्काल थर्ड-पार्टी इंटीग्रेशन विकल्पों की अनुपस्थिति के बावजूद ओमनी-मोडल अंतःक्रिया के लिए एक नया मानक स्थापित करती है।