El equipo Seed de ByteDance ha presentado SeedRealtime, un modelo de lenguaje grande nativo de audio y video full-dúplex que fusiona audio, video y texto en una única arquitectura unificada. A diferencia de las pilas en cascada tradicionales de módulos ASR, VLM y TTS, SeedRealtime ejecuta la percepción, la comprensión, la toma de decisiones y la expresión en paralelo para permitir interacciones en tiempo real sobre flujos multimodales continuos.
- El modelo reemplaza los detectores externos de actividad de voz con mecanismos internos de turnos.
- Demuestra vinculación de identidad a través de modalidades, habla proactiva basada en instrucciones previas y corrección según el estado visual.
- Las evaluaciones humanas indican que los problemas de ritmo se redujeron a la mitad en comparación con las pilas en cascada.
- SeedRealtime está actualmente activo dentro de la aplicación Doubao de ByteDance, pero carece de un informe técnico, pesos abiertos o puntos finales de API públicos.
El lanzamiento sirve como una arquitectura de referencia validada para productos de voz en tiempo real con cámara, estableciendo un nuevo punto de referencia para la interacción omni-modal a pesar de la ausencia de opciones de integración de terceros inmediatas.