Reka ha lanzado una vista previa de investigación de Rho-1, un modelo de 19B parámetros entrenado desde cero que procesa texto, imágenes, video y acciones de robots dentro de una única red neuronal. Esta arquitectura busca reemplazar las tuberías multimodales tradicionales eliminando los cambios entre modelos especialistas, permitiendo que todas las modalidades se manejen como tokens en una sola ventana de contexto.
- El modelo utiliza dos flujos expertos (comprensión y generación) que comparten atención y un único KV cache en cada bloque transformer.
- Los tokens discretos manejan texto y razonamiento, mientras que los tokens continuos gestionan latentes de imagen, fotogramas de video y acciones de robots.
- Una variante destilada reduce los pasos de denoising de 99 a 8, generando un clip de 5.3 segundos en aproximadamente un segundo con una pérdida mínima de calidad.
- El modelo base genera video a 0.79x la velocidad en tiempo real, con el primer clip apareciendo en unos 6 segundos.
- Para robótica, Rho-1 emite tokens de acción continuos y se empareja con un Modelo de Dinámica Inversa para inferir señales de control a partir de video sin procesar.
Al colapsar la pila multimodal en un único modelo, Reka afirma que este enfoque reduce la latencia y permite una dirección en tiempo real y rollouts continuos sin llamadas a herramientas externas ni modelos secundarios.