A Reka lançou uma prévia de pesquisa do Rho-1, um modelo de 19B parâmetros treinado do zero que processa texto, imagens, vídeo e ações de robôs dentro de uma única rede neural. Essa arquitetura visa substituir os pipelines multimodais tradicionais ao eliminar as transições entre modelos especialistas, permitindo que todas as modalidades sejam tratadas como tokens em uma única janela de contexto.
- O modelo utiliza dois fluxos de especialistas (compreensão e geração) que compartilham atenção e um único cache KV em cada bloco transformer.
- Tokens discretos lidam com texto e raciocínio, enquanto tokens contínuos gerenciam latentes de imagem, quadros de vídeo e ações de robôs.
- Uma variante destilada reduz os passos de denoising de 99 para 8, gerando um clipe de 5,3 segundos em cerca de um segundo com perda mínima de qualidade.
- O modelo base gera vídeo a 0,79x da velocidade em tempo real, com o primeiro clipe aparecendo em aproximadamente 6 segundos.
- Para robótica, o Rho-1 emite tokens de ação contínuos e é combinado com um Modelo de Dinâmica Inversa para inferir sinais de controle a partir de vídeo bruto.
Ao colapsar a pilha multimodal em um único modelo, a Reka afirma que essa abordagem reduz a latência e permite o direcionamento em tempo real e rollouts contínuos sem chamadas de ferramentas externas ou modelos secundários.