Reka a publié une version de recherche de Rho-1, un modèle de 19 milliards de paramètres entraîné à partir de zéro qui traite le texte, les images, la vidéo et les actions robotiques au sein d'un seul réseau neuronal. Cette architecture vise à remplacer les pipelines multimodaux traditionnels en éliminant les transferts entre modèles spécialisés, permettant ainsi de traiter toutes les modalités comme des tokens dans une seule fenêtre de contexte.

  • Le modèle utilise deux flux experts (compréhension et génération) qui partagent l'attention et un seul cache KV dans chaque bloc transformeur.
  • Les tokens discrets gèrent le texte et le raisonnement, tandis que les tokens continus gèrent les latents d'image, les frames vidéo et les actions robotiques.
  • Une variante distillée réduit le nombre d'étapes de débruitage de 99 à 8, générant un clip de 5,3 secondes en environ une seconde avec une perte de qualité minimale.
  • Le modèle de base génère de la vidéo à une vitesse de 0,79x par rapport au temps réel, le premier clip apparaissant en environ 6 secondes.
  • Pour la robotique, Rho-1 émet des tokens d'action continus et s'apparie avec un Modèle de Dynamique Inverse pour inférer les signaux de contrôle à partir de la vidéo brute.

En réduisant la pile multimodale à un seul modèle, Reka affirme que cette approche réduit la latence et permet une direction en temps réel et des rollouts continus sans appels d'outils externes ni modèles secondaires.