ByteDance Seed présente SeedRealtime, un LLM natif audio-visuel en duplex intégral
L'équipe Seed de ByteDance a présenté SeedRealtime, un grand modèle linguistique natif audio-visuel en duplex intégral qui fusionne l'audio, la vidéo et le texte dans une architecture unifiée unique. Contrairement aux piles en cascade traditionnelles de modules ASR, VLM et TTS, SeedRealtime exécute la perception, la compréhension, la prise de décision et l'expression en parallèle pour permettre une interaction en temps réel sur des flux multimodaux continus.