Sujet · Video generation
lab Google — The Keyword (AI) · il y a 29 j · 7 vues

Google ajoute Gemini Omni et des avatars personnels à Google Vids

Google a déployé deux nouvelles mises à jour pour Google Vids : l'intégration de Gemini Omni pour la génération et l'édition de vidéos basées sur du texte, ainsi qu'une fonctionnalité permettant aux utilisateurs de créer des avatars numériques personnels. Ces outils visent à simplifier la création vidéo en permettant aux utilisateurs de générer des extraits à partir de prompts en langage naturel et de références image, tout en apparaissant dans des vidéos sans enregistrement physique.

lab NVIDIA Research · il y a 5 h · 1 vue

HorizonRelight utilise l'auto-conditionnement masqué pour un relighting vidéo cohérent sur le long terme

Les chercheurs abordent les discontinuités temporelles dans le relighting vidéo de longue durée en reformulant la tâche comme une traduction de domaine latent conditionnée temporellement. Le cadre impose une continuité inter-blocs en propageant les latents du domaine cible à travers les frontières et utilise l'auto-conditionnement masqué du domaine cible pour rendre ce comportement apprenable.

media MarkTechPost · il y a 3 j · 7 vues

LTX publie LTX-2.5, un modèle du monde à poids ouverts pour la génération vidéo locale

LTX a publié LTX-2.5, un modèle du monde à poids ouverts pour la génération vidéo, les applications en temps réel et l'IA physique, optimisé pour l'inférence locale sur les GPU NVIDIA RTX et le matériel DGX Spark. Cette publication vise à déplacer la production vidéo de l'infrastructure cloud vers les bureaux locaux en réduisant les exigences VRAM et en éliminant les frais par génération.

media r/LocalLLaMA · il y a 5 j · 11 vues

MiniMax lance le modèle vidéo H3 à poids ouverts avec audio synchronisé

MiniMax a lancé MiniMax H3, un modèle multimodal de génération vidéo à poids ouverts capable de traiter du texte, des images, de la vidéo et de l'audio. Le modèle génère conjointement des visuels et de l'audio stéréo synchronisé, incluant des dialogues, des effets sonores, une ambiance et de la musique, au lieu d'ajouter l'audio comme une étape de post-traitement.

media r/LocalLLaMA · il y a 5 j · 9 vues

MiniMax lance le modèle de génération vidéo H3 à poids ouverts avec audio stéréo natif

MiniMax a publié sur Hugging Face le modèle omnimodal de génération vidéo H3 à poids ouverts, doté d'un audio stéréo natif capable de piloter la vidéo en un seul passage avant. Le modèle prend en charge une résolution 2K à 24 fps pour des clips de 5 à 15 secondes et accepte jusqu'à neuf images de référence, trois vidéos et trois extraits audio par génération.

media MarkTechPost · il y a 14 j · 17 vues

MiniMax publie MiniMax H3, un modèle vidéo omni-modal générant des clips 2K avec audio stéréo natif

MiniMax a publié MiniMax H3, un modèle de génération multimodale polyvalent qui unifie le texte, l'image, la vidéo et l'audio dans un seul contexte pour produire des clips vidéo 2K d'une durée maximale de 15 secondes avec du son stéréo natif. Contrairement aux précédentes architectures reposant sur des modèles experts distincts pour des tâches spécifiques, H3 permet aux utilisateurs d'exprimer des relations de référence et d'édition via des invites en langage naturel.

lab Hugging Face Blog · il y a 19 j · 23 vues

NVIDIA présente Cosmos-H-Dreams, un simulateur génératif en temps réel pour la robotique chirurgicale

NVIDIA a présenté Cosmos-H-Dreams, un simulateur génératif conditionné par l'action et en temps réel pour la robotique chirurgicale, qui condense les capacités de son Cosmos-H-Surgical-Simulator dans un modèle étudiant causal. Pris en charge par la bibliothèque FlashDreams de NVIDIA dédiée au streaming accéléré d'inférence, le système permet un contrôle interactif par une personne ou une politique apprise en boucle fermée.

lab Hugging Face Blog · il y a 28 j · 5 vues

NVIDIA NeMo Automodel permet le fine-tuning distribué de modèles de diffusion avec Hugging Face Diffusers

NVIDIA et Hugging Face ont intégré NVIDIA NeMo Automodel à la bibliothèque 🤗 Diffusers pour fournir un entraînement distribué de qualité production pour les modèles de diffusion open-source. Cette collaboration permet aux utilisateurs de fine-tuner n'importe quel modèle au format Diffusers sur le Hub Hugging Face sans nécessiter de conversion de checkpoints ni de réécriture du code du modèle.

lab NVIDIA Technical Blog · il y a 29 j · 1 vue

NVIDIA discute de l'intégration d'agents vidéo IA conscients du contexte dans les flux de travail d'entreprise

Un agent IA d'analyse vidéo capable de percevoir, de raisonner et d'agir sur d'énormes quantités d'images doit être intégré aux flux de travail existants pour être utile. Ces flux de travail incluent les systèmes de gestion de contenu, les plateformes de messagerie, les bases de données, les files d'attente de tickets et les chemins d'escalade.