Video generation
media MarkTechPost · há 8 d · 15 visualizações

MiniMax lança o MiniMax H3, um modelo de vídeo omni-modal que gera clipes em 2K com áudio estéreo nativo

A MiniMax lançou o MiniMax H3, um modelo multimodal de propósito geral que unifica texto, imagem, vídeo e áudio em um único contexto para produzir clipes de vídeo em 2K com até 15 segundos de duração e som estéreo nativo. Diferente das pilhas anteriores que dependem de modelos especialistas separados para tarefas específicas, o H3 permite que os usuários expressem relações de referência e edição por meio de prompts em linguagem natural.

lab Hugging Face Blog · há 13 d · 19 visualizações

NVIDIA apresenta Cosmos-H-Dreams, um simulador generativo em tempo real para robótica cirúrgica

A NVIDIA apresentou o Cosmos-H-Dreams, um simulador generativo em tempo real e condicionado a ações para robótica cirúrgica que destila as capacidades de seu Cosmos-H-Surgical-Simulator em um modelo estudante causal. Atendido por meio da biblioteca FlashDreams da NVIDIA, otimizada para streaming-inference acelerado, o sistema permite controle interativo por uma pessoa ou política aprendida em loop fechado.

lab Hugging Face Blog · há 23 d · 5 visualizações

NVIDIA NeMo Automodel permite ajuste fino distribuído de modelos de difusão com Diffusers do Hugging Face

A NVIDIA e a Hugging Face integraram o NVIDIA NeMo Automodel à biblioteca 🤗 Diffusers para fornecer treinamento distribuído de nível de produção para modelos de difusão de código aberto. Essa colaboração permite que os usuários ajustem qualquer modelo no formato Diffusers do Hugging Face Hub sem exigir conversão de checkpoints ou reescrita do código do modelo.

lab Google — The Keyword (AI) · há 23 d · 6 visualizações

Google adiciona Gemini Omni e avatares pessoais ao Google Vids

A Google lançou duas novas atualizações para o Google Vids: a integração do Gemini Omni para geração e edição de vídeos baseados em texto, e um recurso que permite aos usuários criar avatares digitais pessoais. Essas ferramentas visam simplificar a criação de vídeos, permitindo que os usuários gerem clipes a partir de prompts de linguagem natural e referências de imagens, além de atuarem em vídeos sem necessidade de gravação física.

lab NVIDIA Technical Blog · há 24 d

NVIDIA discute a integração de agentes de IA de vídeo com consciência de contexto em fluxos de trabalho empresariais

Um agente de IA de análise de vídeo capaz de perceber, raciocinar e agir sobre grandes quantidades de material de vídeo deve ser integrado aos fluxos de trabalho existentes para ser útil. Esses fluxos de trabalho incluem sistemas de gerenciamento de conteúdo, plataformas de mensagens, bancos de dados, filas de tickets e caminhos de escalonamento.

arxiv arXiv cs.CL · há 24 d

Text2Sign: linha de base de difusão para uma única GPU na geração de vídeos de linguagem de sinais a partir de texto

Os pesquisadores apresentam o Text2Sign, um modelo de difusão condicionado por texto projetado para gerar clipes curtos de linguagem de sinais em uma única GPU NVIDIA L4, abordando os altos custos associados ao treinamento e à avaliação de modelos de difusão de vídeo. O sistema combina um codificador de texto vision-language congelado com um codificador-decodificador 3D e atenção espaciotemporal fatorizada para reduzir os requisitos computacionais enquanto preserva a coerência do movimento.

lab NVIDIA Technical Blog · há 24 d

NVIDIA DeepStream 9.1 permite rastreamento 3D multicanal

Desenvolvedores que criam aplicativos de análise de vídeo em grandes espaços precisam rastrear o mesmo objeto enquanto ele se move entre as visões das câmeras. O rastreamento 2D de uma única câmera carece de informações confiáveis de profundidade e geralmente perde o objeto quando ele sai do quadro, limitando aplicações como segurança em armazéns, análise de varejo e monitoramento de edifícios inteligentes.

arxiv arXiv cs.LG · há 25 d

A lacuna de serialidade em modelos de difusão de vídeo

Pesquisadores identificam a "lacuna de serialidade" em modelos de difusão de vídeo, onde o desempenho se degrada à medida que as cadeias causais se alongam durante simulações de dinâmica de esferas rígidas com múltiplas bolas. Experimentos controlados mostram que essa degradação é causada por estruturas de eventos dependentes e não pelo comprimento do vídeo, pois desaparece nos controles de uma única bola sem interações.