Laboratoire · ByteDance
media MarkTechPost · il y a 5 j · 3 vues

ByteDance Seed présente SeedRealtime, un LLM natif audio-visuel en duplex intégral

L'équipe Seed de ByteDance a présenté SeedRealtime, un grand modèle linguistique natif audio-visuel en duplex intégral qui fusionne l'audio, la vidéo et le texte dans une architecture unifiée unique. Contrairement aux piles en cascade traditionnelles de modules ASR, VLM et TTS, SeedRealtime exécute la perception, la compréhension, la prise de décision et l'expression en parallèle pour permettre une interaction en temps réel sur des flux multimodaux continus.

media r/LocalLLaMA · il y a 5 j · 9 vues

MiniMax lance le modèle de génération vidéo H3 à poids ouverts avec audio stéréo natif

MiniMax a publié sur Hugging Face le modèle omnimodal de génération vidéo H3 à poids ouverts, doté d'un audio stéréo natif capable de piloter la vidéo en un seul passage avant. Le modèle prend en charge une résolution 2K à 24 fps pour des clips de 5 à 15 secondes et accepte jusqu'à neuf images de référence, trois vidéos et trois extraits audio par génération.