Laboratório · NVIDIA
lab NVIDIA Research · há 4 h · 1 visualização

HorizonRelight usa autocondicionamento mascarado para relighting consistente de vídeo em longo prazo

Os pesquisadores abordam descontinuidades temporais no relighting de vídeos de longo prazo reformulando a tarefa como tradução de domínio latente condicionado temporalmente. A estrutura impõe continuidade entre blocos propagando os latentes do domínio-alvo através dos limites e utiliza autocondicionamento mascarado do domínio-alvo para tornar esse comportamento aprendível.

lab NVIDIA Research · há 4 h · 2 visualizações

Nvidia apresenta FusionRelight para realinhamento de retratos em tempo real por meio da fusão híbrida de conhecimento de domínio

Pesquisadores da Nvidia introduziram o FusionRelight, um método para realinhamento de retratos que combina transferência de iluminação fisicamente plausível com preservação de identidade e inferência compacta em tempo real. A abordagem utiliza a Fusão Híbrida de Conhecimento de Domínio (HDKF), uma estrutura de treinamento que destila priors de física, refletância e realismo a partir de dados sintéticos, One-Light-at-a-Time (OLAT) e in-the-wild em um modelo estudante.

lab NVIDIA Research · há 3 d · 10 visualizações

NVIDIA lança OmniDreams, modelo de mundo generativo em tempo real para simulação de veículos autônomos

A NVIDIA apresentou o OmniDreams, um modelo de mundo generativo fundamental projetado para resolver os gargalos na avaliação de políticas de direção autônoma dentro de simulações em loop fechado. Treinado intermediária e posteriormente a partir do modelo de difusão Cosmos com 21 mil horas de cenários de condução, ele gera vídeos condicionados por ações em tempo real de forma autoregressiva.

lab NVIDIA Research · há 18 d · 9 visualizações

NVIDIA apresenta o Spatial-IQ, um framework de diagnóstico hierárquico para raciocínio espacial em modelos multimodais

Pesquisadores da NVIDIA introduziram o Spatial-IQ, um framework de diagnóstico projetado para decompor a inteligência espacial de grandes modelos de linguagem multimodais (MLLMs). Diferente dos benchmarks existentes que tratam os modelos como caixas-pretas, esta abordagem decompõe a contagem de objetos em estruturas 3D empilhadas em nove sub-tarefas perceptivas e cognitivas alinhadas com estágios do desenvolvimento humano.

lab NVIDIA Research · há 18 d · 13 visualizações

Quantização de Codebook Agrupado para Compressão de Imagens Baseada em Gaussiana 2D

Pesquisadores apresentam o Cluster-Guided Vector Quantization (CGVQ), um método projetado para melhorar o desempenho de taxa-distorção na compressão de imagens baseada em primitivas gaussianas. A abordagem particiona os parâmetros de Gaussiana em grupos homogêneos antes da quantização, abordando a ineficiência causada pelo armazenamento de grandes números de parámetros de ponto flutuante por primitiva.

lab Hugging Face Blog · há 25 d · 1 visualização

NVIDIA lança Cosmos 3 Edge, um modelo de 4 bilhões de parâmetros para controle de robôs em tempo real em dispositivos de borda

A NVIDIA lançou o Cosmos 3 Edge, um modelo de mundo aberto com 4 bilhões de parâmetros projetado para oferecer desempenho de nível de data center em sistemas de borda com memória limitada. O modelo permite que robôs e agentes de IA de visão compreendam seu entorno, raciocinem em tempo real e gerem ações diretamente em dispositivos como os módulos NVIDIA Jetson.

lab Hugging Face Blog · há 29 d · 8 visualizações

NVIDIA lança modelos de embedding Nemotron 3 Embed que ocupam o #1 no RTEB

A NVIDIA lançou o Nemotron 3 Embed, uma coleção de modelos de embedding abertos e comercialmente disponíveis projetados para melhorar a qualidade de recuperação para RAG em escala de produção, recuperação agêntica, recuperação de código e memória de agentes. A coleção inclui um modelo de 8B que ocupa a #1 posição geral no ranking do RTEB, junto com variantes eficientes de 1B otimizadas para implantação.

media MarkTechPost · há 3 d · 1 visualização

NVIDIA lança modelo Nemotron 3.5 Lightning e roteador NeMo Switchyard

A NVIDIA lançou dois artefatos de código aberto projetados para construir agentes de IA sempre ativos: o modelo Nemotron 3.5 Lightning e a biblioteca de roteamento NeMo Switchyard. Essas ferramentas abordam o alto custo e a latência de enviar cada etapa de fluxos de trabalho de agentes de longa duração para modelos de raciocínio de ponta, fornecendo capacidades especializadas de execução e roteamento.

media MarkTechPost · há 5 d · 13 visualizações

NVIDIA lança NemotronLabs VoiceChat 11B, um modelo de fala-para-fala full-duplex aberto com troca de turno em ~450 ms

A NVIDIA lançou o NemotronLabs VoiceChat 11B, um modelo de ponta a ponta de fala-para-fala aberto com 11B de parâmetros, projetado para conversação full-duplex em tempo real. Diferente das pilhas em cascata que encadeiam ASR, LLM e TTS, esta rede unificada realiza compreensão e geração de streaming de fala simultaneamente, alcançando uma latência medida de troca de turno suave de 448 ms no Full-Duplex-Bench 1.0.

media MarkTechPost · há 7 d · 4 visualizações

NVIDIA lança NOOA, um framework Python orientado a objetos para construir agentes de IA

O NVIDIA Labs lançou o código-fonte aberto do NOOA (NVIDIA Object-Oriented Agents), um framework Python agnóstico a modelos que consolida o desenvolvimento de agentes em uma única classe Python. Essa abordagem substitui fluxos de trabalho fragmentados envolvendo templates de prompt e grafos de fluxo, mapeando métodos para ações, campos para estado, docstrings para prompts e anotações de tipo para contratos impostos.