Video generation
media MarkTechPost · il y a 8 j · 15 vues

MiniMax publie MiniMax H3, un modèle vidéo omni-modal générant des clips 2K avec audio stéréo natif

MiniMax a publié MiniMax H3, un modèle de génération multimodale polyvalent qui unifie le texte, l'image, la vidéo et l'audio dans un seul contexte pour produire des clips vidéo 2K d'une durée maximale de 15 secondes avec du son stéréo natif. Contrairement aux précédentes architectures reposant sur des modèles experts distincts pour des tâches spécifiques, H3 permet aux utilisateurs d'exprimer des relations de référence et d'édition via des invites en langage naturel.

lab Hugging Face Blog · il y a 13 j · 19 vues

NVIDIA présente Cosmos-H-Dreams, un simulateur génératif en temps réel pour la robotique chirurgicale

NVIDIA a présenté Cosmos-H-Dreams, un simulateur génératif conditionné par l'action et en temps réel pour la robotique chirurgicale, qui condense les capacités de son Cosmos-H-Surgical-Simulator dans un modèle étudiant causal. Pris en charge par la bibliothèque FlashDreams de NVIDIA dédiée au streaming accéléré d'inférence, le système permet un contrôle interactif par une personne ou une politique apprise en boucle fermée.

lab Hugging Face Blog · il y a 23 j · 5 vues

NVIDIA NeMo Automodel permet le fine-tuning distribué de modèles de diffusion avec Hugging Face Diffusers

NVIDIA et Hugging Face ont intégré NVIDIA NeMo Automodel à la bibliothèque 🤗 Diffusers pour fournir un entraînement distribué de qualité production pour les modèles de diffusion open-source. Cette collaboration permet aux utilisateurs de fine-tuner n'importe quel modèle au format Diffusers sur le Hub Hugging Face sans nécessiter de conversion de checkpoints ni de réécriture du code du modèle.

lab Google — The Keyword (AI) · il y a 23 j · 6 vues

Google ajoute Gemini Omni et des avatars personnels à Google Vids

Google a déployé deux nouvelles mises à jour pour Google Vids : l'intégration de Gemini Omni pour la génération et l'édition de vidéos basées sur du texte, ainsi qu'une fonctionnalité permettant aux utilisateurs de créer des avatars numériques personnels. Ces outils visent à simplifier la création vidéo en permettant aux utilisateurs de générer des extraits à partir de prompts en langage naturel et de références image, tout en apparaissant dans des vidéos sans enregistrement physique.

lab NVIDIA Technical Blog · il y a 24 j

NVIDIA discute de l'intégration d'agents vidéo IA conscients du contexte dans les flux de travail d'entreprise

Un agent IA d'analyse vidéo capable de percevoir, de raisonner et d'agir sur d'énormes quantités d'images doit être intégré aux flux de travail existants pour être utile. Ces flux de travail incluent les systèmes de gestion de contenu, les plateformes de messagerie, les bases de données, les files d'attente de tickets et les chemins d'escalade.

arxiv arXiv cs.CL · il y a 24 j

Text2Sign : base de diffusion mono-GPU pour la génération de vidéos de langue des signes à partir de texte

Les chercheurs présentent Text2Sign, un modèle de diffusion conditionné par du texte conçu pour générer de courts extraits de langue des signes sur un seul GPU NVIDIA L4, afin de réduire les coûts élevés associés à l'entraînement et à l'évaluation des modèles de diffusion vidéo. Le système combine un encodeur de texte vision-langue figé avec un encodeur-décoder 3D et une attention spatio-temporelle factorisée pour diminuer les exigences computationnelles tout en préservant la cohérence du mouvement.

lab NVIDIA Technical Blog · il y a 24 j

NVIDIA DeepStream 9.1 permet le suivi 3D multi-caméras

Les développeurs qui créent des applications d'analyse vidéo sur de grands espaces doivent suivre le même objet lorsqu'il se déplace entre les vues des caméras. Le suivi 2D par caméra unique manque d'informations de profondeur fiables et perd généralement l'objet lorsqu'il sort du cadre, limitant ainsi des applications telles que la sécurité des entrepôts, l'analyse du détail et la surveillance des bâtiments intelligents.

arxiv arXiv cs.LG · il y a 25 j

Le fossé de sérialité dans les modèles de diffusion vidéo

Les chercheurs identifient le "fossé de sérialité" dans les modèles de diffusion vidéo, où la performance se dégrade à mesure que les chaînes causales s'allongent lors des simulations de dynamique de sphères dures multi-balles. Des expériences contrôlées montrent que cette dégradation est causée par des structures d'événements dépendants plutôt que par la longueur de la vidéo, car elle disparaît dans les contrôles à une seule balle sans interactions.

media r/LocalLLaMA · il y a 26 j · 1 vue

Wan-Dancer génère des vidéos de danse cohérentes de durée minutée synchronisées avec la musique

Les chercheurs ont présenté Wan-Dancer, un cadre hiérarchique qui génère des vidéos de danse de longue durée et haute définition synchronisées avec la musique. Le système surmonte la limitation typique de 20 secondes des modèles de diffusion en découpant la génération en planification globale de clés (keyframes) et en raffinement temporel local.