L'équipe Seed de ByteDance a présenté SeedRealtime, un grand modèle linguistique natif audio-visuel en duplex intégral qui fusionne l'audio, la vidéo et le texte dans une architecture unifiée unique. Contrairement aux piles en cascade traditionnelles de modules ASR, VLM et TTS, SeedRealtime exécute la perception, la compréhension, la prise de décision et l'expression en parallèle pour permettre une interaction en temps réel sur des flux multimodaux continus.

  • Le modèle remplace les détecteurs d'activité vocale externes par des mécanismes internes de prise de parole.
  • Il démontre un lien d'identité à travers les modalités, une parole proactive issue d'instructions mémorisées et une correction basée sur l'état visuel.
  • Les évaluations humaines indiquent que les problèmes de rythme ont été réduits de moitié par rapport aux piles en cascade.
  • SeedRealtime est actuellement actif dans l'application Doubao de ByteDance mais ne dispose ni de rapport technique, ni de poids ouverts, ni de points d'API publics.

Cette publication sert d'architecture de référence validée pour les produits vocaux intégrant une caméra, établissant un nouveau benchmark pour l'interaction omni-modale malgré l'absence d'options d'intégration tierce immédiates.