A equipe Seed da ByteDance apresentou o SeedRealtime, um modelo de linguagem grande (LLM) full-duplex nativo de áudio e vídeo que funde áudio, vídeo e texto em uma única arquitetura unificada. Diferente das pilhas em cascata tradicionais de módulos ASR, VLM e TTS, o SeedRealtime executa percepção, compreensão, tomada de decisão e expressão em paralelo para permitir interação em tempo real sobre fluxos multimodais contínuos.

  • O modelo substitui detectores externos de atividade de voz por mecanismos internos de alternância de fala.
  • Ele demonstra vinculação de identidade entre modalidades, fala proativa a partir de instruções armazenadas e correção com base no estado visual.
  • Relatórios de avaliação humana indicam que os problemas de ritmo foram reduzidos pela metade em comparação com as pilhas em cascata.
  • O SeedRealtime está atualmente ativo dentro do aplicativo Doubao da ByteDance, mas carece de relatório técnico, pesos abertos ou endpoints de API pública.

O lançamento serve como uma arquitetura de referência validada para produtos de voz em tempo real com câmera, estabelecendo um novo benchmark para interação omni-modal apesar da ausência de opções imediatas de integração de terceiros.