Tema · Research paper
lab Google DeepMind Blog · há 8 d · 27 visualizações

Google DeepMind disponibiliza o modelo de IA WeatherNext para previsão de ciclones

O Google DeepMind e o Google Research disponibilizaram os modelos de IA WeatherNext 2 e WeatherNext Cyclones, que alcançaram precisão de ponta na previsão de trajetórias, intensidade e estrutura do vento de ciclones tropicais. Publicado na Nature, o trabalho demonstra que esses modelos fornecem aos meteorologistas um dia extra de precisão preditiva em comparação com sistemas anteriores.

lab OpenAI News · há 14 d · 23 visualizações

Modelo Astra resolve dez problemas abertos em matemática e ciência da computação teórica

O modelo interno Astra da OpenAI gerou soluções para dez problemas abertos de longa data em matemática e ciência da computação teórica, com os argumentos formalizados em Lean. Esses resultados abrangem geometria de alta dimensão, teoria dos códigos, teoria dos grupos e complexidade quântica, abordando questões que não tinham avanços há pelo menos uma década.

lab NVIDIA Research · há 2 h · 1 visualização

HorizonRelight usa autocondicionamento mascarado para relighting consistente de vídeo em longo prazo

Os pesquisadores abordam descontinuidades temporais no relighting de vídeos de longo prazo reformulando a tarefa como tradução de domínio latente condicionado temporalmente. A estrutura impõe continuidade entre blocos propagando os latentes do domínio-alvo através dos limites e utiliza autocondicionamento mascarado do domínio-alvo para tornar esse comportamento aprendível.

lab NVIDIA Research · há 2 d · 38 visualizações

LLMs igualam ou superam a otimização bayesiana para otimização de hiperparâmetros

Um novo artigo explora o uso de modelos de linguagem grandes fundamentais (LLMs) para automatizar a otimização de hiperparâmetros (HPO), um processo que normalmente depende de abordagens manuais em configurações com orçamento limitado. Os autores desenvolveram uma metodologia onde os LLMs sugerem configurações de hiperparâmetros com base nas descrições do conjunto de dados e do modelo, que são então refinadas iterativamente de acordo com o desempenho do modelo.

lab NVIDIA Research · há 2 d · 40 visualizações

Fonte introduz diferenciação desenrolada aproximada para atribuição de dados de treinamento

Pesquisadores apresentam o Source, um novo método de atribuição de dados de treinamento (TDA) que combina a eficiência computacional das funções de influência com a precisão das abordagens baseadas em desenrolamento. Ao usar uma fórmula semelhante à função de influência para aproximar a diferenciação desenrolada, o Source aborda limitações nos métodos de diferenciação implícita, como sua falha em considerar o viés de otimização ou pipelines multiestágio.

lab NVIDIA Research · há 2 d · 10 visualizações

NVIDIA lança OmniDreams, modelo de mundo generativo em tempo real para simulação de veículos autônomos

A NVIDIA apresentou o OmniDreams, um modelo de mundo generativo fundamental projetado para resolver os gargalos na avaliação de políticas de direção autônoma dentro de simulações em loop fechado. Treinado intermediária e posteriormente a partir do modelo de difusão Cosmos com 21 mil horas de cenários de condução, ele gera vídeos condicionados por ações em tempo real de forma autoregressiva.

lab Microsoft Research Blog · há 3 d · 11 visualizações

Microsoft Research apresenta CARE-X, um VLM unificado de raios X torácico com supervisão auxiliar e medição aumentada por ferramentas

A Microsoft Research apresentou o CARE-X, um modelo de pesquisa projetado para preencher lacunas nos atuais modelos de visão e linguagem da radiologia, combinando a geração de relatórios generativos com previsões diagnósticas calibradas. O sistema utiliza aprendizado por reforço (DAPO) para recompensar a correção clínica e emparelha o modelo Qwen3-VL-4B-Instruct com ferramentas de medição determinísticas para avaliar o desempenho em condições que exigem cálculos precisos.

lab NVIDIA Research · há 3 d · 14 visualizações

DSTP mitiga falhas na poda de tokens visuais no raciocínio complexo de MLLM

Pesquisadores identificaram o Deslocamento de Informação Visual Relevante (RVIS) durante a decodificação como a causa principal da falha dos métodos existentes de poda de tokens visuais em Modelos de Linguagem Grande Multimodais (MLLMs). Para abordar isso, eles propõem a Poda de Tokens Consciente do Deslocamento na Fase de Decodificação (DSTP), um framework sem treinamento que alinha os tokens visuais com os requisitos de raciocínio em mudança.

lab NVIDIA Research · há 3 d · 3 visualizações

GenRecal destila grandes modelos de visão e linguagem em pequenos por meio de recalibração

Pesquisadores apresentam o GenRecal, um framework de destilação de propósito geral que transfere conhecimento de grandes modelos de visão e linguagem (VLM) para contrapartes menores e mais eficientes. O método aborda o desafio das arquiteturas VLM heterogêneas usando um Recalibrator para alinhar e adaptar representações de características entre diferentes tipos de modelos.

lab NVIDIA Research · há 3 d · 9 visualizações

ZPPO usa prompts em vez de gradientes para melhorar o treinamento de modelos pequenos de visão e linguagem

Pesquisadores introduzem a Otimização de Política na Zona Próxima (ZPPO), um método que injeta conhecimento do professor nos prompts, em vez dos gradientes da política, para lidar com a fragilidade na destilação de conhecimento e no desvio no aprendizado por reforço. A ZPPO constrói Perguntas com Candidato Binário Incluído (BCQ) e Perguntas com Candidato Negativo Incluído (NCQ) para perguntas difíceis, recirculando-as por meio de um buffer de replay até que a precisão do aluno melhore ou sejam removidas.

lab NVIDIA Research · há 3 d

Hide to See introduz mascaramento de prefixo de raciocínio para destilação de VLM

Pesquisadores propõem um novo framework de destilação pensar-responder que melhora a capacidade de modelos visuo-linguísticos compactos de utilizar evidência visual ao mascarar prefixos de raciocínio salientes. Esta abordagem aborda o problema do "esquecimento visual" comum em rastros longos de pensar-responder, onde os estudantes perdem o foco nas pistas visuais durante o raciocínio estendido.

lab NVIDIA Research · há 4 d · 1 visualização

SpatialClaw usa código como interface de ação para raciocínio espacial agêntico

Pesquisadores propõem o SpatialClaw, um framework sem treinamento que adota o código como a interface de ação para melhorar o raciocínio espacial aberto 3D e 4D em modelos de visão-linguagem. Diferente dos agentes existentes que dependem de execução de passagem única ou chamadas de ferramentas rígidas, o SpatialClaw mantém um kernel Python com estado pré-carregado com quadros de entrada e primitivas de percepção.

lab NVIDIA Research · há 4 d · 2 visualizações

AXPO melhora o raciocínio agêntico multimodal corrigindo a Lacuna entre Pensamento e Ação

Pesquisadores propõem a Otimização de Política Exploratória de Agentes (AXPO) para abordar a "Lacuna entre Pensamento e Ação" em modelos de visão e linguagem que exigem ferramentas externas. Essa lacuna faz com que métodos padrão de RL, como GRPO, tentem usar ferramentas apenas em ~30% dos rollouts, com altas taxas de falha suprimindo os sinais de aprendizado.