Video generation
arxiv arXiv cs.AI · hace 5 h · 10 vistas

VideoX-Qwen presenta un marco centrado en datos para la edición de video basada en instrucciones

Los investigadores presentan VideoX-Qwen, un marco integrado que combina la construcción escalable de datos con el entrenamiento del modelo para avanzar en la edición de video general e impulsada por instrucciones. El sistema utiliza una canalización de producción que organiza modelos especializados para generar registros de edición direccional, resultando en más de 1.2 millones de muestras de alta calidad en tareas de adición, eliminación, reemplazo y atributos.

lab NVIDIA Research · hace 8 d · 15 vistas

FastGen-PDD introduce distilación de decodificación paralela para generación rápida de video e imagen

Los investigadores presentan la Distilación de Decodificación Paralela (PDD), un método simplificado basado en trayectorias para acelerar la inferencia en modelos de difusión y emparejamiento de flujos. A diferencia de los enfoques actuales que dependen de la distilación variacional de puntuaciones difícil de optimizar y pérdidas adversarias, PDD predice múltiples pasos de desvanecimiento por evaluación de red.

media MarkTechPost · hace 25 d · 51 vistas

Google lanza Gemini Omni 1.1 Flash con extensión de escena de 40 segundos y borradores en 360p

Google ha lanzado Gemini Omni 1.1 Flash, una actualización de producción para su modelo nativo de generación de vídeo multimodal que cambia el enfoque de la generación simple a la edición dirigida. La actualización introduce interacciones con estado mediante la API Interactions, permitiendo a los usuarios modificar vídeos preservando el contexto previo sin volver a cargar archivos.

media Hugging Face Forums · hace 26 d · 39 vistas

Las pruebas de Seedance 2 revelan fortalezas en el movimiento de cámara y la atmósfera

Una evaluación del modelo de generación de video con IA Seedance 2 destaca su mejor comprensión de los elementos cinematográficos en comparación con iteraciones anteriores. La prueba demuestra que, aunque el modelo maneja bien la continuidad visual y la iluminación, aún tiene dificultades con la consistencia de objetos complejos y la sobrecarga de prompts.