Laboratoire · NVIDIA
lab NVIDIA Research · il y a 4 h · 1 vue

HorizonRelight utilise l'auto-conditionnement masqué pour un relighting vidéo cohérent sur le long terme

Les chercheurs abordent les discontinuités temporelles dans le relighting vidéo de longue durée en reformulant la tâche comme une traduction de domaine latent conditionnée temporellement. Le cadre impose une continuité inter-blocs en propageant les latents du domaine cible à travers les frontières et utilise l'auto-conditionnement masqué du domaine cible pour rendre ce comportement apprenable.

lab NVIDIA Research · il y a 4 h · 2 vues

Nvidia présente FusionRelight pour le re-éclairage de portraits en temps réel via une fusion hybride de connaissances de domaine

Des chercheurs de Nvidia ont présenté FusionRelight, une méthode de re-éclairage de portraits qui combine un transfert d'illumination physiquement plausible avec la préservation de l'identité et une inférence compacte en temps réel. L'approche utilise la Fusion Hybride de Connaissances de Domaine (HDKF), un cadre d'entraînement qui distille les a priori de physique, de réflectance et de réalisme à partir de données synthétiques, One-Light-at-a-Time (OLAT) et in-the-wild dans un modèle étudiant.

lab NVIDIA Research · il y a 3 j · 10 vues

NVIDIA publie OmniDreams, un modèle de monde génératif en temps réel pour la simulation de véhicules autonomes

NVIDIA a présenté OmniDreams, un modèle de monde génératif fondamental conçu pour résoudre les goulets d'étranglement dans l'évaluation des politiques de conduite autonome au sein de simulations en boucle fermée. Entraîné en milieu et en post-entraînement à partir du modèle de diffusion Cosmos sur 21k heures de scénarios de conduite, il génère de manière autoregressive des vidéos conditionnées par les actions en temps réel.

lab NVIDIA Research · il y a 18 j · 9 vues

NVIDIA présente Spatial-IQ, un cadre de diagnostic hiérarchique pour le raisonnement spatial des modèles multimodaux

Les chercheurs de NVIDIA ont présenté Spatial-IQ, un cadre de diagnostic conçu pour décomposer l'intelligence spatiale des grands modèles de langage multimodaux (MLLM). Contrairement aux benchmarks existants qui traitent les modèles comme des boîtes noires, cette approche décompose le comptage d'objets dans des structures 3D empilées en neuf sous-tâches perceptives et cognitives alignées sur les étapes du développement humain.

lab NVIDIA Research · il y a 18 j · 13 vues

Quantification de codebook clusterisé pour la compression d'images basée sur des Gaussiennes 2D

Les chercheurs présentent Cluster-Guided Vector Quantization (CGVQ), une méthode conçue pour améliorer les performances taux-distorsion de la compression d'images basée sur des primitives gaussiennes. L'approche partitionne les paramètres de Gaussienne en groupes homogènes avant la quantification, traitant l'inefficacité causée par le stockage de grands nombres de paramètres à virgule flottante par primitive.

media TLDR AI · il y a 18 j · 5 vues

Anthropic publie Claude Opus 5 ; NVIDIA appelle à des politiques de poids ouverts

Anthropic a présenté Claude Opus 5 comme un modèle plus efficace qui approche les capacités de Claude Fable 5 à moitié prix, devenant le modèle par défaut pour Claude Max. Parallèlement, NVIDIA plaide en faveur de politiques gouvernementales américaines pour soutenir les modèles d'IA à poids ouverts afin de favoriser l'innovation et renforcer la domination américaine dans le secteur.

lab Hugging Face Blog · il y a 25 j · 1 vue

NVIDIA lance Cosmos 3 Edge, un modèle de 4 milliards de paramètres pour le contrôle robotique en temps réel sur des appareils edge

NVIDIA a publié Cosmos 3 Edge, un modèle open world de 4 milliards de paramètres conçu pour offrir des performances de niveau data center sur des systèmes edge à mémoire contrainte. Le modèle permet aux robots et aux agents d'IA vision de comprendre leur environnement, de raisonner en temps réel et de générer des actions directement sur des appareils tels que les modules NVIDIA Jetson.

lab Hugging Face Blog · il y a 29 j · 8 vues

NVIDIA lance les modèles Nemotron 3 Embed, classés n°1 sur RTEB

NVIDIA a publié Nemotron 3 Embed, une collection de modèles d'embedding ouverts et disponibles commercialement conçus pour améliorer la qualité de récupération pour le RAG à l'échelle de la production, la récupération agentic, la récupération de code et la mémoire des agents. La collection comprend un modèle 8B classé n°1 au classement général du leaderboard RTEB, ainsi que des variantes 1B optimisées pour le déploiement.

media MarkTechPost · il y a 3 j · 1 vue

NVIDIA publie le modèle Nemotron 3.5 Lightning et le routeur NeMo Switchyard

NVIDIA a publié deux artefacts open-source conçus pour construire des agents IA toujours actifs : le modèle Nemotron 3.5 Lightning et la bibliothèque de routage NeMo Switchyard. Ces outils répondent au coût élevé et à la latence liés à l'envoi de chaque étape des workflows d'agents longue durée vers des modèles de raisonnement de pointe, en offrant des capacités d'exécution et de routage spécialisées.

lab Hugging Face Blog · il y a 4 j · 8 vues

NVIDIA Magpie TTS ajoute l'arabe, le coréen et le portugais, et améliore la qualité

NVIDIA a publié une mise à jour de son modèle Magpie Multilingual TTS, élargissant le support à douze langues avec l'ajout de l'arabe standard moderne, du coréen et du portugais brésilien. La publication inclut également des améliorations de qualité pour les langues existantes grâce à des données d'entraînement mises à jour et des modifications architecturales.

media MarkTechPost · il y a 5 j · 13 vues

NVIDIA publie NemotronLabs VoiceChat 11B, un modèle de parole à parole en duplex intégral ouvert avec une prise de tour d'environ 450 ms

NVIDIA a publié NemotronLabs VoiceChat 11B, un modèle de parole à parole de bout en bout ouvert de 11 milliards de paramètres conçu pour la conversation en temps réel et en duplex intégral. Contrairement aux piles en cascade qui enchaînent ASR, LLM et TTS, ce réseau unifié effectue simultanément la compréhension et la génération de flux audio, atteignant une latence mesurée de prise de tour fluide de 448 ms sur Full-Duplex-Bench 1.0.

media MarkTechPost · il y a 7 j · 4 vues

NVIDIA lance NOOA, un framework Python orienté objet pour créer des agents IA

NVIDIA Labs a open-sourcé NOOA (NVIDIA Object-Oriented Agents), un framework Python indépendant du modèle qui centralise le développement d'agents en une seule classe Python. Cette approche remplace les flux de travail fragmentés impliquant des modèles de prompts et des graphes de workflow en mappant les méthodes aux actions, les champs à l'état, les docstrings aux prompts et les annotations de type aux contrats imposés.