Reka는 텍스트, 이미지, 비디오, 로봇 동작을 단일 신경망에서 처리하는 스크래치부터 훈련된 19B 파라미터 모델인 Rho-1의 연구 프리뷰를 출시했습니다. 이 아키텍처는 전문가 모델 간 전환을 제거하여 모든 모달리티를 하나의 컨텍스트 윈도우 내에서 토큰으로 처리함으로써 전통적인 멀티모달 파이프라인을 대체하는 것을 목표로 합니다.

  • 이 모델은 어텐션과 단일 KV 캐시를 모든 트랜스포머 블록에서 공유하는 두 가지 전문가 스트림(이해와 생성)을 사용합니다.
  • 이산 토큰은 텍스트와 추론을 처리하고, 연속 토큰은 이미지 잠재변수, 비디오 프레임 및 로봇 동작을 관리합니다.
  • 증류된 변형 버전은 디노이징 단계를 99에서 8로 줄여 품질 손실을 최소화하면서 약 1초 만에 5.3초 길이의 클립을 생성합니다.
  • 기본 모델은 실시간 속도의 0.79배로 비디오를 생성하며, 첫 번째 클립은 약 6초 후에 나타납니다.
  • 로봇 공학 분야에서 Rho-1은 연속 동작 토큰을 방출하고 역동역학 모델과 결합하여 원시 비디오에서 제어 신호를 추론합니다.

멀티모달 스택을 단일 모델로 축소함으로써 Reka는 이 접근 방식이 지연 시간을 줄이고 외부 도구 호출이나 보조 모델 없이 실시간 조종과 연속 롤아웃을 가능하게 한다고 주장합니다.