Source · NVIDIA Research
lab NVIDIA Research · il y a 17 h · 7 vues

Symphony orchestre les tenseurs clairsemés et denses avec un traitement hétérogène hiérarchique

L'article propose Symphony, une architecture hybride programmable et spécialisée conçue pour remédier aux inefficacités du système mémoire dans les architectures haute performance actuelles comme les GPU. Elle se concentre sur l'orchestration des données à travers la hiérarchie mémoire afin de réduire les mouvements de données inutiles et la distance.

lab NVIDIA Research · il y a 6 j · 23 vues

HorizonRelight utilise l'auto-conditionnement masqué pour un relighting vidéo cohérent sur le long terme

Les chercheurs abordent les discontinuités temporelles dans le relighting vidéo de longue durée en reformulant la tâche comme une traduction de domaine latent conditionnée temporellement. Le cadre impose une continuité inter-blocs en propageant les latents du domaine cible à travers les frontières et utilise l'auto-conditionnement masqué du domaine cible pour rendre ce comportement apprenable.

lab NVIDIA Research · il y a 6 j · 28 vues

Nvidia présente FusionRelight pour le re-éclairage de portraits en temps réel via une fusion hybride de connaissances de domaine

Des chercheurs de Nvidia ont présenté FusionRelight, une méthode de re-éclairage de portraits qui combine un transfert d'illumination physiquement plausible avec la préservation de l'identité et une inférence compacte en temps réel. L'approche utilise la Fusion Hybride de Connaissances de Domaine (HDKF), un cadre d'entraînement qui distille les a priori de physique, de réflectance et de réalisme à partir de données synthétiques, One-Light-at-a-Time (OLAT) et in-the-wild dans un modèle étudiant.

lab NVIDIA Research · il y a 9 j · 61 vues

Les LLM égalent ou surpassent l'optimisation bayésienne pour l'optimisation des hyperparamètres

Un nouvel article explore l'utilisation de grands modèles linguistiques fondamentaux (LLM) pour automatiser l'optimisation des hyperparamètres (HPO), un processus qui repose généralement sur des approches manuelles dans des configurations à budget limité. Les auteurs ont développé une méthodologie où les LLM suggèrent des configurations d'hyperparamètres basées sur les descriptions du jeu de données et du modèle, qui sont ensuite affinées itérativement en fonction des performances du modèle.

lab NVIDIA Research · il y a 9 j · 56 vues

Source introduit la différenciation déroulée approximative pour l'attribution des données d'entraînement

Les chercheurs présentent Source, une nouvelle méthode d'attribution des données d'entraînement (TDA) qui combine l'efficacité computationnelle des fonctions d'influence avec la précision des approches basées sur le déroulement. En utilisant une formule similaire à la fonction d'influence pour approximer la différenciation déroulée, Source adresse les limitations des méthodes de différenciation implicite, telles que leur incapacité à prendre en compte le biais d'optimisation ou les pipelines multi-étapes.

lab NVIDIA Research · il y a 9 j · 34 vues

NVIDIA publie OmniDreams, un modèle de monde génératif en temps réel pour la simulation de véhicules autonomes

NVIDIA a présenté OmniDreams, un modèle de monde génératif fondamental conçu pour résoudre les goulets d'étranglement dans l'évaluation des politiques de conduite autonome au sein de simulations en boucle fermée. Entraîné en milieu et en post-entraînement à partir du modèle de diffusion Cosmos sur 21k heures de scénarios de conduite, il génère de manière autoregressive des vidéos conditionnées par les actions en temps réel.

lab NVIDIA Research · il y a 9 j · 31 vues

jlorraine présente des outils d'optimisation imbriquée évolutifs pour l'apprentissage profond

L'article introduit une thèse de jlorraine qui aborde les défis de l'application de l'optimisation à deux niveaux ou imbriquée aux configurations d'apprentissage profond à grande échelle. Alors que l'optimisation basée sur le gradient met généralement à jour un seul ensemble de paramètres, de nombreuses applications nécessitent la mise à jour de sous-ensembles de paramètres sur différents objectifs imbriqués les uns dans les autres.

lab NVIDIA Research · il y a 10 j · 36 vues

DSTP atténue les échecs de l'élagage des tokens visuels dans le raisonnement complexe des MLLM

Les chercheurs ont identifié le Décalage de l'Information Visuelle Pertinente (RVIS) pendant le décodage comme la cause principale de l'échec des méthodes existantes d'élagage des tokens visuels dans les Modèles de Langage Large Multimodaux (MLLM). Pour remédier à cela, ils proposent l'Élagage de Tokens Aware du Décalage au Stade de Décodage (DSTP), un cadre sans entraînement qui aligne les tokens visuels avec les exigences de raisonnement changeantes.

lab NVIDIA Research · il y a 10 j · 26 vues

GenRecal distille de grands modèles vision-langage en petits par recalibration

Les chercheurs présentent GenRecal, un framework de distillation à usage général qui transfère des connaissances de grands modèles vision-langage (VLM) vers des contreparties plus petites et plus efficaces. La méthode aborde le défi des architectures VLM hétérogènes en utilisant un Recalibrator pour aligner et adapter les représentations de caractéristiques entre différents types de modèles.

lab NVIDIA Research · il y a 10 j · 28 vues

ZPPO utilise des invites au lieu de gradients pour améliorer l'entraînement de petits modèles vision-langage

Les chercheurs présentent la Zone of Proximal Policy Optimization (ZPPO), une méthode qui injecte les connaissances du professeur dans les invites plutôt que dans les gradients de politique, afin de pallier la fragilité de la distillation des connaissances et la dérive en apprentissage par renforcement. ZPPO construit des Binary Candidate-included Questions (BCQ) et des Negative Candidate-included Questions (NCQ) pour les questions difficiles, en les recirculant via un tampon de rejeu jusqu'à ce que la précision de l'étudiant s'améliore ou qu'elles soient évacuées.

lab NVIDIA Research · il y a 10 j · 21 vues

Hide to See introduit le masquage du préfixe de raisonnement pour la distillation VLM

Les chercheurs proposent un nouveau cadre de distillation penser-réponse qui améliore la capacité des modèles visuo-linguistiques compacts à utiliser des preuves visuelles en masquant les préfixes de raisonnement saillants. Cette approche aborde le problème de l'"oubli visuel" courant dans les traces longues de penser-réponse, où les étudiants perdent le focus sur les indices visuels pendant le raisonnement étendu.

lab NVIDIA Research · il y a 10 j · 15 vues

SpatialClaw utilise le code comme interface d'action pour le raisonnement spatial agentique

Les chercheurs proposent SpatialClaw, un framework sans entraînement qui adopte le code comme interface d'action pour améliorer le raisonnement spatial ouvert 3D et 4D dans les modèles vision-langage. Contrairement aux agents existants qui dépendent d'exécutions en un seul passage ou d'appels d'outils rigides, SpatialClaw maintient un noyau Python avec état préchargé avec des frames d'entrée et des primitives de perception.

lab NVIDIA Research · il y a 10 j · 27 vues

AXPO améliore le raisonnement agentique multimodal en comblant l'écart entre réflexion et action

Les chercheurs proposent l'Optimisation de la Politique d'Exploration Agentique (AXPO) pour combler l'écart « Thinking-Acting Gap » dans les modèles vision-langage qui nécessitent des outils externes. Cet écart entraîne les méthodes RL standard comme GRPO à tenter d'utiliser des outils sur seulement ~30% des rollouts, avec des taux d'échec élevés qui suppriment les signaux d'apprentissage.

lab NVIDIA Research · il y a 15 j · 36 vues

ROSA améliore la productivité des usines jusqu'à 12,06x grâce au service de partage de pools GPU

Les chercheurs proposent ROSA, un système de déploiement de modèle fondamental pour la robotique conçu pour les usines de robots qui va au-delà des hypothèses de calcul en périphérie pour un seul robot. Le système utilise le service de partage de pools GPU pour permettre aux flottes de robots d'accéder à des GPUs de classe serveur via le réseau.

lab NVIDIA Research · il y a 24 j · 28 vues

NVIDIA présente Spatial-IQ, un cadre de diagnostic hiérarchique pour le raisonnement spatial des modèles multimodaux

Les chercheurs de NVIDIA ont présenté Spatial-IQ, un cadre de diagnostic conçu pour décomposer l'intelligence spatiale des grands modèles de langage multimodaux (MLLM). Contrairement aux benchmarks existants qui traitent les modèles comme des boîtes noires, cette approche décompose le comptage d'objets dans des structures 3D empilées en neuf sous-tâches perceptives et cognitives alignées sur les étapes du développement humain.

lab NVIDIA Research · il y a 24 j · 38 vues

Quantification de codebook clusterisé pour la compression d'images basée sur des Gaussiennes 2D

Les chercheurs présentent Cluster-Guided Vector Quantization (CGVQ), une méthode conçue pour améliorer les performances taux-distorsion de la compression d'images basée sur des primitives gaussiennes. L'approche partitionne les paramètres de Gaussienne en groupes homogènes avant la quantification, traitant l'inefficacité causée par le stockage de grands nombres de paramètres à virgule flottante par primitive.