Video generation
arxiv arXiv cs.AI · il y a 5 h · 10 vues

VideoX-Qwen présente un cadre centré sur les données pour l'édition vidéo basée sur des instructions

Les chercheurs présentent VideoX-Qwen, un cadre intégré combinant la construction évolutive de données avec l'entraînement du modèle pour faire progresser l'édition vidéo générale et pilotée par des instructions. Le système utilise un pipeline de production qui organise des modèles spécialisés pour générer des enregistrements d'édition directionnelle, résultant en plus de 1,2 million d'échantillons de haute qualité dans les tâches d'ajout, de suppression, de remplacement et d'attributs.

lab NVIDIA Research · il y a 8 j · 15 vues

FastGen-PDD introduit la distillation de décodage parallèle pour une génération rapide de vidéos et d'images

Les chercheurs introduisent la distillation de décodage parallèle (PDD), une méthode simplifiée basée sur des trajectoires pour accélérer l'inférence dans les modèles de diffusion et d'appariement de flux. Contrairement aux approches actuelles qui reposent sur une distillation de score variationnel difficile à optimiser et des pertes adversariales, PDD prédit plusieurs étapes de débruitage par évaluation du réseau.

media MarkTechPost · il y a 25 j · 51 vues

Google publie Gemini Omni 1.1 Flash avec extension de scène de 40 secondes et brouillons en 360p

Google a publié Gemini Omni 1.1 Flash, une mise à jour de production de son modèle natif de génération vidéo multimodale qui déplace l'accent d'une simple génération vers un éditage dirigé. La mise à jour introduit des interactions avec état via l'API Interactions, permettant aux utilisateurs de modifier les vidéos tout en préservant le contexte antérieur sans réuploader de fichiers.

media Hugging Face Forums · il y a 26 j · 39 vues

Les tests de Seedance 2 révèlent des forces dans le mouvement de caméra et l'atmosphère

Une évaluation du modèle de génération vidéo IA Seedance 2 met en évidence sa meilleure compréhension des éléments cinématographiques par rapport aux itérations précédentes. Le test démontre que, bien que le modèle gère bien la continuité visuelle et l'éclairage, il a encore du mal avec la cohérence des objets complexes et la surcharge de prompts.