Rekaは、テキスト、画像、動画、ロボットの動作を単一のニューラルネットワークで処理するゼロから学習された19Bパラメータモデル「Rho-1」の研究プレビューを公開した。このアーキテクチャは、専門モデル間のハンドオフを排除し、すべてのモダリティを1つのコンテキストウィンドウ内でトークンとして扱うことで、従来のマルチモーダルパイプラインの置き換えを目指している。

  • モデルは、注意機構と各トランスフォーマーブロックで単一のKVキャッシュを共有する2つの専門ストリーム(理解用と生成用)を使用する。
  • 離散トークンはテキストと推論を処理し、連続トークンは画像潜在変数、動画フレーム、ロボットの動作を管理する。
  • ディスティル化されたバリアントはノイズ除去ステップを99から8に削減し、品質の最小限の低下で約1秒間に5.3秒分のクリップを生成する。
  • ベースモデルはリアルタイム速度の0.79倍で動画を生成し、最初のクリップは約6秒後に現れる。
  • ロボティクスにおいて、Rho-1は連続アクショントークンを出力し、逆動力学モデルと組み合わせて生動画から制御信号を推論する。

マルチモーダルスタックを単一モデルに集約することで、Rekaはこのアプローチがレイテンシを削減し、外部ツール呼び出しやセカンダリモデルなしでリアルタイムのステアリングと連続的なロールアウトを可能であると主張している。