Команда ByteDance Seed представила SeedRealtime — нативную полнодуплексную большую языковую модель, объединяющую аудио, видео и текст в единой архитектуре. В отличие от традиционных каскадных стеков из модулей ASR, VLM и TTS, SeedRealtime выполняет восприятие, понимание, принятие решений и генерацию ответа параллельно, обеспечивая взаимодействие в реальном времени через непрерывные мультимодальные потоки.
- Модель заменяет внешние детекторы речевой активности внутренними механизмами переключения реплик.
- Она демонстрирует привязку идентичности между модальностями, проактивную речь на основе удерживаемых инструкций и коррекции на основе визуального состояния.
- Результаты человеческой оценки показывают, что проблемы с темпом речи сократились вдвое по сравнению с каскадными стеками.
- SeedRealtime уже доступна в приложении Doubao от ByteDance, но пока не имеет технического отчёта, открытых весов или публичных API-эндпоинтов.
Выпуск служит подтверждённой эталонной архитектурой для продуктов с голосом и камерой в реальном времени, устанавливая новый стандарт взаимодействия во всех модальностях, несмотря на отсутствие немедленных возможностей интеграции со сторонними сервисами.