Reka ने Rho-1 का शोध पूर्वावलोकन जारी किया, एक 19B पैरामीटर वाला मॉडल जिसे शून्य से प्रशिक्षित किया गया है जो टेक्स्ट, छवियों, वीडियो और रोबोट एक्शन को एकल न्यूरल नेटवर्क में संसाधित करता है। यह आर्किटेक्चर पारंपरिक मल्टीमोडल पाइपलाइन को विशेषज्ञ मॉडलों के बीच हैंडऑफ़ को समाप्त करके प्रतिस्थापित करने का लक्ष्य रखता है, जिससे सभी मोडेलिटीज़ को एक संदर्भ विंडो में टोकन के रूप में संभाला जा सकता है।
- मॉडल दो विशेषज्ञ स्ट्रीम (समझ और जनरेशन) का उपयोग करता है जो प्रत्येक ट्रान्सफ़ॉर्मर ब्लॉक में एटेंशन और एकल KV कैश साझा करते हैं।
- डिस्क्रीट टोकन टेक्स्ट और रीजनिंग को संभालते हैं, जबकि कंटिन्यूअस टोकन छवि लैटेंट्स, वीडियो फ्रेम और रोबोट एक्शन का प्रबंधन करते हैं।
- एक डिस्टिल्ड वेरिएंट डीनोइजिंग स्टेप्स को 99 से घटाकर 8 कर देता है, जिससे लगभग एक सेकंड में 5.3-सेकंड का क्लिप बहुत कम गुणवत्ता हानि के साथ जनरेट होता है।
- बेस मॉडल वीडियो को 0.79x रियल-टाइम गति पर जनरेट करता है, जिसमें पहला क्लिप लगभग 6 सेकंड में दिखाई देता है।
- रोबोटिक्स के लिए, Rho-1 कंटिन्यूअस एक्शन टोकन उत्सर्जित करता है और कच्चे वीडियो से नियंत्रण संकेतों को इनफ़र करने के लिए एक इन्वर्स डायनेमिक्स मॉडल के साथ जुड़ता है।
मल्टीमोडल स्टैक को एकल मॉडल में समेटकर, Reka का दावा है कि यह दृष्टिकोण लेटेंसी को कम करता है और बाहरी टूल कॉल या सेकंडरी मॉडलों के बिना रियल-टाइम स्टीयरिंग और कंटिन्यूअस रोलआउट की अनुमति देता है।