Video generation
media MarkTechPost · hace 8 d · 15 vistas

MiniMax lanza MiniMax H3, un modelo de video omnimodal que genera clips en 2K con audio estéreo nativo

MiniMax ha lanzado MiniMax H3, un modelo de generación multimodales de propósito general que unifica texto, imagen, video y audio en un solo contexto para producir clips de video en 2K de hasta 15 segundos con sonido estéreo nativo. A diferencia de las pilas anteriores que dependen de modelos expertos separados para tareas específicas, H3 permite a los usuarios expresar relaciones de referencia y edición mediante prompts en lenguaje natural.

lab Hugging Face Blog · hace 13 d · 19 vistas

NVIDIA presenta Cosmos-H-Dreams, un simulador generativo en tiempo real para robótica quirúrgica

NVIDIA ha presentado Cosmos-H-Dreams, un simulador generativo en tiempo real y condicionado por acciones para robótica quirúrgica que destila las capacidades de su Cosmos-H-Surgical-Simulator en un modelo estudiante causal. Servido a través de la biblioteca FlashDreams de NVIDIA para inferencia acelerada con streaming, el sistema permite el control interactivo por una persona o una política aprendida en un bucle cerrado.

lab Hugging Face Blog · hace 23 d · 5 vistas

NVIDIA NeMo Automodel permite el ajuste fino distribuido de modelos de difusión con Hugging Face Diffusers

NVIDIA y Hugging Face han integrado NVIDIA NeMo Automodel con la biblioteca 🤗 Diffusers para proporcionar entrenamiento distribuido de nivel de producción para modelos de difusión de código abierto. Esta colaboración permite a los usuarios ajustar cualquier modelo en formato Diffusers en el Hub de Hugging Face sin requerir conversión de puntos de control ni reescritura del código del modelo.

lab Google — The Keyword (AI) · hace 23 d · 6 vistas

Google añade Gemini Omni y avatares personales a Google Vids

Google ha lanzado dos nuevas actualizaciones para Google Vids: la integración de Gemini Omni para la generación y edición de videos basados en texto, y una función que permite a los usuarios crear avatares digitales personales. Estas herramientas tienen como objetivo simplificar la creación de videos al permitir a los usuarios generar clips a partir de indicaciones en lenguaje natural y referencias de imágenes, así como protagonizar videos sin necesidad de grabación física.

arxiv arXiv cs.CL · hace 24 d

Text2Sign: línea base de difusión con una sola GPU para la generación de vídeos de lenguaje de signos a partir de texto

Los investigadores presentan Text2Sign, un modelo de difusión condicionado por texto diseñado para generar clips cortos de lenguaje de signos en una única GPU NVIDIA L4, abordando los altos costos asociados con el entrenamiento y la evaluación de modelos de difusión de vídeo. El sistema combina un codificador de texto visión-lenguaje congelado con un codificador-decodificador 3D y atención espacial-temporal factorizada para reducir los requisitos computacionales mientras se preserva la coherencia del movimiento.

lab NVIDIA Technical Blog · hace 24 d

NVIDIA DeepStream 9.1 habilita el seguimiento 3D multicanal

Los desarrolladores que crean aplicaciones de análisis de video en grandes espacios deben rastrear el mismo objeto mientras se mueve entre las vistas de la cámara. El seguimiento 2D de una sola cámara carece de información confiable de profundidad y generalmente pierde el objeto cuando sale del marco, lo que limita aplicaciones como la seguridad en almacenes, análisis minoristas y monitoreo de edificios inteligentes.

arxiv arXiv cs.LG · hace 25 d

La brecha de serialidad en modelos de difusión de video

Los investigadores identifican la "brecha de serialidad" en los modelos de difusión de video, donde el rendimiento se degrada a medida que las cadenas causales se alargan durante las simulaciones de dinámica de esferas duras con múltiples bolas. Los experimentos controlados muestran que esta degradación es causada por estructuras de eventos dependientes en lugar de la longitud del video, ya que desaparece en los controles de una sola bola sin interacciones.