أطلق فريق بايت دانس سيد نموذج SeedRealtime، وهو نموذج لغوي كبير أصلي للصوت والمرئيات يعمل بنظام ثنائي الاتجاه، يدمج الصوت والفيديو والنص في بنية موحدة واحدة. وعلى عكس الطبقات المتسلسلة التقليدية لمكونات التعرف على الكلام (ASR)، وفهم الصور (VLM)، وتوليف الكلام (TTS)، يعمل SeedRealtime على الإدراك والفهم واتخاذ القرار والتعبير بالتوازي لتمكين التفاعل في الوقت الفعلي عبر تدفقات متعددة الوسائط بشكل مستمر.

  • يحل النموذج محل كاشفات نشاط الصوت الخارجية بآليات داخلية لتبادل الأدوار.
  • يُظهر ربط الهوية عبر الوسائط، ونطقاً استباقياً بناءً على تعليمات محفوظة، وتصحيحاً يعتمد على الحالة المرئية.
  • تشير تقييمات المستخدمين البشريين إلى أن مشكلات وتيرة الكلام قد انخفضت إلى النصف مقارنة بالطبقات المتسلسلة.
  • يعمل SeedRealtime حالياً داخل تطبيق بايت دانس Doubao، لكنه يفتقر إلى تقرير فني، أو أوزان مفتوحة المصدر، أو نقاط نهاية واجهة برمجة تطبيقات عامة.

يُعد هذا الإصدار بنية مرجعية موثقة لمنتجات الصوت والكاميرا في الوقت الفعلي، ويضع معياراً جديداً للتفاعل متعدد الوسائط الشامل رغم عدم وجود خيارات تكامل فورية لأطراف ثالثة.