Tim Seed dari ByteDance telah memperkenalkan SeedRealtime, model bahasa besar (LLM) full-duplex audio-visual asli yang menyatukan audio, video, dan teks dalam satu arsitektur terpadu. Berbeda dengan tumpukan bertingkat tradisional dari modul ASR, VLM, dan TTS, SeedRealtime menjalankan persepsi, pemahaman, pengambilan keputusan, dan ekspresi secara paralel untuk memungkinkan interaksi real-time melalui aliran multimodal yang berkelanjutan.

  • Model ini menggantikan detektor aktivitas suara eksternal dengan mekanisme pergantian giliran internal.
  • Model ini menunjukkan pengikatan identitas antar modalitas, ucapan proaktif berdasarkan instruksi yang tersimpan, serta koreksi berdasarkan keadaan visual.
  • Evaluasi manusia melaporkan bahwa masalah ritme berkurang setengah dibandingkan dengan tumpukan bertingkat.
  • SeedRealtime saat ini aktif di dalam aplikasi Doubao milik ByteDance, namun belum tersedia laporan teknis, bobot terbuka, atau titik akhir API publik.

Rilis ini berfungsi sebagai arsitektur referensi yang terverifikasi untuk produk suara-plus-kamera real-time, menetapkan tolok ukur baru untuk interaksi omni-modal meskipun tidak ada opsi integrasi pihak ketiga segera.