أطلقت Reka نسخة بحثية أولية من Rho-1، وهو نموذج بـ 19 مليار معلمة تم تدريبه من الصفر لمعالجة النصوص والصور والفيديو وإجراءات الروبوت داخل شبكة عصبية واحدة. يهدف هذا الهيكل إلى استبدال خطوط الأنظمة متعددة الوسائط التقليدية عن طريق إزالة نقاط الانتقال بين النماذج المتخصصة، مما يسمح بمعالجة جميع الوسائط كرموز في نافذة سياق واحدة.

  • يستخدم النموذج تيارين خبيرين (الفهم والتوليد) يتشاركان الانتباه ومخزن KV واحد في كل كتلة محوّل.
  • تتعامل الرموز المنفصلة مع النصوص والاستدلال، بينما تدير الرموز المستمرة تمثيلات الصور وإطارات الفيديو وإجراءات الروبوت.
  • يقلل المتغير المُكثّف خطوات إزالة الضوضاء من 99 إلى 8، مولّداً مقطعاً مدته 5.3 ثانية في حوالي ثانية واحدة بأقل فقدان للجودة.
  • يولّد النموذج الأساسي الفيديو بسرعة 0.79x من السرعة الحقيقية، ويظهر المقطع الأول بعد حوالي 6 ثوانٍ.
  • بالنسبة للروبوتات، يُصدر Rho-1 رموز إجراءات مستمرة ويتكامل مع نموذج ديناميكيات عكسية لاستنتاج إشارات التحكم من الفيديو الخام.

من خلال دمج المكدس متعدد الوسائط في نموذج واحد، تدعي Reka أن هذا النهج يقلل زمن الاستجابة ويسمح بالتوجيه في الوقت الفعلي والتنفيذ المستمر دون استدعاءات أدوات خارجية أو نماذج ثانوية.