Reka发布了Rho-1的研究预览版,这是一个从零开始训练的19B参数模型,能够在单个神经网络中处理文本、图像、视频和机器人动作。该架构旨在通过消除专家模型之间的手动交接来取代传统的多模态流水线,使所有模态都能在一个上下文窗口中以token形式进行处理。
- 该模型使用两个专家流(理解和生成),在每个transformer块中共享注意力机制和单个KV缓存。
- 离散token处理文本和推理,而连续token管理图像潜在变量、视频帧和机器人动作。
- 蒸馏变体将去噪步骤从99步减少到8步,在几乎不损失质量的情况下,约一秒钟生成一段5.3秒的视频片段。
- 基础模型以0.79倍实时速度生成视频,第一个片段大约需要6秒出现。
- 在机器人领域,Rho-1输出连续动作token,并与逆动力学模型(Inverse Dynamics Model)配合,从原始视频中推断控制信号。
通过将多模态堆栈合并为单个模型,Reka声称这种方法降低了延迟,并允许进行实时控制和连续 rollout,无需外部工具调用或辅助模型。