Reka telah merilis pratinjau penelitian dari Rho-1, sebuah model dengan 19 miliar parameter yang dilatih dari awal untuk memproses teks, gambar, video, dan aksi robot dalam satu jaringan saraf. Arsitektur ini bertujuan menggantikan pipeline multimodal tradisional dengan menghilangkan perpindahan antar model spesialis, memungkinkan semua modalitas ditangani sebagai token dalam satu jendela konteks.
- Model ini menggunakan dua aliran ahli (pemahaman dan generasi) yang berbagi perhatian dan satu KV cache di setiap blok transformer.
- Token diskrit menangani teks dan penalaran, sementara token kontinu mengelola latens gambar, frame video, dan aksi robot.
- Varian distilasi mengurangi langkah denoising dari 99 menjadi 8, menghasilkan klip 5,3 detik dalam sekitar satu detik dengan kehilangan kualitas minimal.
- Model dasar menghasilkan video pada kecepatan 0,79x waktu nyata, dengan klip pertama muncul dalam sekitar 6 detik.
- Untuk robotika, Rho-1 mengeluarkan token aksi kontinu dan dipasangkan dengan Model Dinamika Terbalik untuk menyimpulkan sinyal kendali dari video mentah.
Dengan meruntuhkan tumpukan multimodal menjadi satu model, Reka mengklaim pendekatan ini mengurangi latensi dan memungkinkan pengendalian waktu nyata serta rollouts berkelanjutan tanpa panggilan alat eksternal atau model sekunder.