Reka выпустила исследовательский превью Rho-1 — модель на 19B параметров, обученную с нуля, которая обрабатывает текст, изображения, видео и действия роботов в рамках одной нейронной сети. Эта архитектура призвана заменить традиционные мультимодальные конвейеры, устраняя передачу данных между специализированными моделями и позволяя обрабатывать все модальности как токены в одном контекстном окне.
- Модель использует два экспертных потока (понимание и генерация), которые разделяют внимание и единый KV cache в каждом трансформерном блоке.
- Дискретные токены обрабатывают текст и рассуждения, а непрерывные токены управляют латентами изображений, кадрами видео и действиями роботов.
- Дистиллированная версия сокращает шаги денормализации с 99 до 8, генерируя 5.3-секундный клип примерно за одну секунду при минимальной потере качества.
Базовая модель генерирует видео со скоростью 0.79x от реального времени, при этом первый клип появляется примерно через 6 секунд.
- Для робототехники Rho-1 генерирует непрерывные токены действий и в сочетании с Inverse Dynamics Model выводит управляющие сигналы из сырого видео.
Сворачивая мультимодальный стек в одну модель, Reka утверждает, что такой подход снижает задержку и позволяет осуществлять реальное время управления и непрерывные проходы без внешних вызовов инструментов или вторичных моделей.