Tema · Video generation
lab NVIDIA Research · há 16 d · 20 visualizações

FastGen-PDD introduz destilação de decodificação paralela para geração rápida de vídeo e imagem

Pesquisadores introduzem a Destilação de Decodificação Paralela (PDD), um método simplificado baseado em trajetória para acelerar a inferência em modelos de difusão e correspondência de fluxo. Ao contrário das abordagens atuais que dependem de destilação variacional de pontuação difícil de otimizar e perdas adversariais, o PDD prevê múltiplos passos de desruído por avaliação da rede.

media MarkTechPost · há 6 h

Pesquisadores da NVIDIA lançam Physis-Lang para melhorar o raciocínio físico nos modelos de vídeo Cosmos 3

Pesquisadores da NVIDIA, MIT e da Universidade de Oxford apresentaram o Physis-Lang, um framework que aprimora os modelos de mundo em vídeo ao integrar linguagem física autoevolutiva nas legendas. Essa abordagem trata a linguagem física como uma representação otimizável usada para curadoria de dados, treinamento do modelo e inferência, corrigindo erros físicos nos vídeos gerados.

media MarkTechPost · há 3 d · 11 visualizações

Google Research apresenta 4 estruturas agênticas para geração de vídeos coerentes com duração de minutos

O Google Research apresentou um co-diretor de vídeo por IA composto por quatro estruturas agênticas projetadas para gerar vídeos coerentes com duração de minutos, abordando a deriva de identidade e erros em cascata comuns em pipelines multi-takes. O sistema opera como uma camada de orquestração independente de modelo sobre o Gemini e Veo, utilizando marca d'água SynthID na saída.

media Latent Space · há 6 d · 11 visualizações

Runway apresenta o WorldPrompt para geração de mundos interativos em tempo real

A Runway lançou o GWM Worlds 2, uma prévia de pesquisa que transforma a geração de vídeo e áudio de alta fidelidade em simulação interativa em tempo real por meio de um modelo de difusão autoregressivo. O lançamento inclui o WorldPrompt, um novo formato de entrada que permite aos usuários especificar mundos e ações gerados ao fixar aspectos do ambiente e criar eventos com carimbos de data e hora.

arxiv arXiv cs.AI · há 8 d · 17 visualizações

VideoX-Qwen apresenta estrutura centrada em dados para edição de vídeo baseada em instruções

Pesquisadores apresentam o VideoX-Qwen, uma estrutura integrada que combina construção escalável de dados com treinamento de modelo para avançar na edição de vídeo de propósito geral e orientada por instruções. O sistema utiliza um pipeline de produção que organiza modelos especializados para gerar registros de edição direcional, resultando em mais de 1,2 milhão de amostras de alta qualidade nas tarefas de adição, remoção, substituição e atributos.