Fonte · NVIDIA Research
lab NVIDIA Research · há 6 d · 23 visualizações

HorizonRelight usa autocondicionamento mascarado para relighting consistente de vídeo em longo prazo

Os pesquisadores abordam descontinuidades temporais no relighting de vídeos de longo prazo reformulando a tarefa como tradução de domínio latente condicionado temporalmente. A estrutura impõe continuidade entre blocos propagando os latentes do domínio-alvo através dos limites e utiliza autocondicionamento mascarado do domínio-alvo para tornar esse comportamento aprendível.

lab NVIDIA Research · há 6 d · 28 visualizações

Nvidia apresenta FusionRelight para realinhamento de retratos em tempo real por meio da fusão híbrida de conhecimento de domínio

Pesquisadores da Nvidia introduziram o FusionRelight, um método para realinhamento de retratos que combina transferência de iluminação fisicamente plausível com preservação de identidade e inferência compacta em tempo real. A abordagem utiliza a Fusão Híbrida de Conhecimento de Domínio (HDKF), uma estrutura de treinamento que destila priors de física, refletância e realismo a partir de dados sintéticos, One-Light-at-a-Time (OLAT) e in-the-wild em um modelo estudante.

lab NVIDIA Research · há 9 d · 61 visualizações

LLMs igualam ou superam a otimização bayesiana para otimização de hiperparâmetros

Um novo artigo explora o uso de modelos de linguagem grandes fundamentais (LLMs) para automatizar a otimização de hiperparâmetros (HPO), um processo que normalmente depende de abordagens manuais em configurações com orçamento limitado. Os autores desenvolveram uma metodologia onde os LLMs sugerem configurações de hiperparâmetros com base nas descrições do conjunto de dados e do modelo, que são então refinadas iterativamente de acordo com o desempenho do modelo.

lab NVIDIA Research · há 9 d · 56 visualizações

Fonte introduz diferenciação desenrolada aproximada para atribuição de dados de treinamento

Pesquisadores apresentam o Source, um novo método de atribuição de dados de treinamento (TDA) que combina a eficiência computacional das funções de influência com a precisão das abordagens baseadas em desenrolamento. Ao usar uma fórmula semelhante à função de influência para aproximar a diferenciação desenrolada, o Source aborda limitações nos métodos de diferenciação implícita, como sua falha em considerar o viés de otimização ou pipelines multiestágio.

lab NVIDIA Research · há 9 d · 34 visualizações

NVIDIA lança OmniDreams, modelo de mundo generativo em tempo real para simulação de veículos autônomos

A NVIDIA apresentou o OmniDreams, um modelo de mundo generativo fundamental projetado para resolver os gargalos na avaliação de políticas de direção autônoma dentro de simulações em loop fechado. Treinado intermediária e posteriormente a partir do modelo de difusão Cosmos com 21 mil horas de cenários de condução, ele gera vídeos condicionados por ações em tempo real de forma autoregressiva.

lab NVIDIA Research · há 9 d · 31 visualizações

jlorraine apresenta ferramentas de otimização aninhada escaláveis para aprendizado profundo

O artigo introduz uma tese de jlorraine que aborda os desafios de aplicar otimização bilevel ou aninhada a configurações de aprendizado profundo em larga escala. Enquanto a otimização baseada em gradiente tipicamente atualiza um único conjunto de parâmetros, muitas aplicações exigem a atualização de subconjuntos de parâmetros em diferentes objetivos aninhados uns dentro dos outros.

lab NVIDIA Research · há 10 d · 36 visualizações

DSTP mitiga falhas na poda de tokens visuais no raciocínio complexo de MLLM

Pesquisadores identificaram o Deslocamento de Informação Visual Relevante (RVIS) durante a decodificação como a causa principal da falha dos métodos existentes de poda de tokens visuais em Modelos de Linguagem Grande Multimodais (MLLMs). Para abordar isso, eles propõem a Poda de Tokens Consciente do Deslocamento na Fase de Decodificação (DSTP), um framework sem treinamento que alinha os tokens visuais com os requisitos de raciocínio em mudança.

lab NVIDIA Research · há 10 d · 26 visualizações

GenRecal destila grandes modelos de visão e linguagem em pequenos por meio de recalibração

Pesquisadores apresentam o GenRecal, um framework de destilação de propósito geral que transfere conhecimento de grandes modelos de visão e linguagem (VLM) para contrapartes menores e mais eficientes. O método aborda o desafio das arquiteturas VLM heterogêneas usando um Recalibrator para alinhar e adaptar representações de características entre diferentes tipos de modelos.

lab NVIDIA Research · há 10 d · 28 visualizações

ZPPO usa prompts em vez de gradientes para melhorar o treinamento de modelos pequenos de visão e linguagem

Pesquisadores introduzem a Otimização de Política na Zona Próxima (ZPPO), um método que injeta conhecimento do professor nos prompts, em vez dos gradientes da política, para lidar com a fragilidade na destilação de conhecimento e no desvio no aprendizado por reforço. A ZPPO constrói Perguntas com Candidato Binário Incluído (BCQ) e Perguntas com Candidato Negativo Incluído (NCQ) para perguntas difíceis, recirculando-as por meio de um buffer de replay até que a precisão do aluno melhore ou sejam removidas.

lab NVIDIA Research · há 10 d · 21 visualizações

Hide to See introduz mascaramento de prefixo de raciocínio para destilação de VLM

Pesquisadores propõem um novo framework de destilação pensar-responder que melhora a capacidade de modelos visuo-linguísticos compactos de utilizar evidência visual ao mascarar prefixos de raciocínio salientes. Esta abordagem aborda o problema do "esquecimento visual" comum em rastros longos de pensar-responder, onde os estudantes perdem o foco nas pistas visuais durante o raciocínio estendido.

lab NVIDIA Research · há 10 d · 15 visualizações

SpatialClaw usa código como interface de ação para raciocínio espacial agêntico

Pesquisadores propõem o SpatialClaw, um framework sem treinamento que adota o código como a interface de ação para melhorar o raciocínio espacial aberto 3D e 4D em modelos de visão-linguagem. Diferente dos agentes existentes que dependem de execução de passagem única ou chamadas de ferramentas rígidas, o SpatialClaw mantém um kernel Python com estado pré-carregado com quadros de entrada e primitivas de percepção.

lab NVIDIA Research · há 10 d · 27 visualizações

AXPO melhora o raciocínio agêntico multimodal corrigindo a Lacuna entre Pensamento e Ação

Pesquisadores propõem a Otimização de Política Exploratória de Agentes (AXPO) para abordar a "Lacuna entre Pensamento e Ação" em modelos de visão e linguagem que exigem ferramentas externas. Essa lacuna faz com que métodos padrão de RL, como GRPO, tentem usar ferramentas apenas em ~30% dos rollouts, com altas taxas de falha suprimindo os sinais de aprendizado.

lab NVIDIA Research · há 24 d · 28 visualizações

NVIDIA apresenta o Spatial-IQ, um framework de diagnóstico hierárquico para raciocínio espacial em modelos multimodais

Pesquisadores da NVIDIA introduziram o Spatial-IQ, um framework de diagnóstico projetado para decompor a inteligência espacial de grandes modelos de linguagem multimodais (MLLMs). Diferente dos benchmarks existentes que tratam os modelos como caixas-pretas, esta abordagem decompõe a contagem de objetos em estruturas 3D empilhadas em nove sub-tarefas perceptivas e cognitivas alinhadas com estágios do desenvolvimento humano.

lab NVIDIA Research · há 24 d · 38 visualizações

Quantização de Codebook Agrupado para Compressão de Imagens Baseada em Gaussiana 2D

Pesquisadores apresentam o Cluster-Guided Vector Quantization (CGVQ), um método projetado para melhorar o desempenho de taxa-distorção na compressão de imagens baseada em primitivas gaussianas. A abordagem particiona os parâmetros de Gaussiana em grupos homogêneos antes da quantização, abordando a ineficiência causada pelo armazenamento de grandes números de parámetros de ponto flutuante por primitiva.