Laboratório · ByteDance
media MarkTechPost · há 5 d · 4 visualizações

Seed da ByteDance apresenta o SeedRealtime, um LLM full-duplex nativo de áudio e vídeo

A equipe Seed da ByteDance apresentou o SeedRealtime, um modelo de linguagem grande (LLM) full-duplex nativo de áudio e vídeo que funde áudio, vídeo e texto em uma única arquitetura unificada. Diferente das pilhas em cascata tradicionais de módulos ASR, VLM e TTS, o SeedRealtime executa percepção, compreensão, tomada de decisão e expressão em paralelo para permitir interação em tempo real sobre fluxos multimodais contínuos.

media r/LocalLLaMA · há 5 d · 9 visualizações

MiniMax lança modelo de geração de vídeo H3 com pesos abertos e áudio estéreo nativo

A MiniMax lançou o modelo omnimodal de geração de vídeo H3 com pesos abertos no Hugging Face, apresentando áudio estéreo nativo que pode impulsionar o vídeo em uma única passagem direta. O modelo suporta resolução 2K a 24fps para clipes de 5 a 15 segundos e aceita até nove imagens de referência, três vídeos e três clipes de áudio por geração.