Sujet · Video generation
lab NVIDIA Research · il y a 16 j · 20 vues

FastGen-PDD introduit la distillation de décodage parallèle pour une génération rapide de vidéos et d'images

Les chercheurs introduisent la distillation de décodage parallèle (PDD), une méthode simplifiée basée sur des trajectoires pour accélérer l'inférence dans les modèles de diffusion et d'appariement de flux. Contrairement aux approches actuelles qui reposent sur une distillation de score variationnel difficile à optimiser et des pertes adversariales, PDD prédit plusieurs étapes de débruitage par évaluation du réseau.

media MarkTechPost · il y a 6 h

Les chercheurs de NVIDIA publient Physis-Lang pour améliorer le raisonnement physique dans les modèles vidéo Cosmos 3

Des chercheurs de NVIDIA, du MIT et de l'Université d'Oxford ont présenté Physis-Lang, un cadre qui améliore les modèles mondiaux vidéo en intégrant un langage physique auto-évolutif dans les légendes. Cette approche traite le langage physique comme une représentation optimisable utilisée pour la curation des données, l'entraînement du modèle et l'inférence afin de corriger les erreurs physiques dans les vidéos générées.

media MarkTechPost · il y a 3 j · 11 vues

Google Research présente 4 cadres agents pour la génération vidéo cohérente de plusieurs minutes

Google Research a présenté un co-réalisateur vidéo IA composé de quatre cadres agents conçus pour générer des vidéos cohérentes de plusieurs minutes en traitant les dérives d'identité et les erreurs en cascade courantes dans les pipelines multi-prises. Le système fonctionne comme une couche d'orchestration indépendante du modèle au-dessus de Gemini et Veo, utilisant le filigrane SynthID pour la sortie.

media Latent Space · il y a 6 j · 11 vues

Runway présente WorldPrompt pour la génération de mondes interactifs en temps réel

Runway a introduit GWM Worlds 2, un aperçu de recherche qui transforme la génération vidéo et audio haute fidélité en simulation interactive en temps réel à l'aide d'un modèle de diffusion autoregressif. La version inclut WorldPrompt, un nouveau format d'entrée permettant aux utilisateurs de spécifier les mondes générés et les actions en fixant certains aspects de l'environnement et en créant des événements horodatés.

arxiv arXiv cs.AI · il y a 8 j · 17 vues

VideoX-Qwen présente un cadre centré sur les données pour l'édition vidéo basée sur des instructions

Les chercheurs présentent VideoX-Qwen, un cadre intégré combinant la construction évolutive de données avec l'entraînement du modèle pour faire progresser l'édition vidéo générale et pilotée par des instructions. Le système utilise un pipeline de production qui organise des modèles spécialisés pour générer des enregistrements d'édition directionnelle, résultant en plus de 1,2 million d'échantillons de haute qualité dans les tâches d'ajout, de suppression, de remplacement et d'attributs.