Sujet · Research paper
lab Google DeepMind Blog · il y a 9 j · 27 vues

Google DeepMind open source le modèle IA WeatherNext pour la prévision des cyclones

Google DeepMind et Google Research ont open-sourcé les modèles IA WeatherNext 2 et WeatherNext Cyclones, qui ont atteint une précision de pointe dans la prédiction des trajectoires, de l'intensité et de la structure du vent des cyclones tropicaux. Publié dans Nature, ce travail démontre que ces modèles offrent aux prévisionnistes un jour supplémentaire de précision prédictive par rapport aux systèmes antérieurs.

lab OpenAI News · il y a 14 j · 23 vues

Le modèle Astra résout dix problèmes ouverts en mathématiques et en informatique théorique

Le modèle interne Astra d'OpenAI a généré des solutions à dix problèmes ouverts de longue date en mathématiques et en informatique théorique, avec les arguments formalisés dans Lean. Ces résultats couvrent la géométrie de haute dimension, la théorie du codage, la théorie des groupes et la complexité quantique, abordant des questions qui n'avaient connu aucun progrès depuis au moins une décennie.

lab NVIDIA Research · il y a 10 h · 9 vues

HorizonRelight utilise l'auto-conditionnement masqué pour un relighting vidéo cohérent sur le long terme

Les chercheurs abordent les discontinuités temporelles dans le relighting vidéo de longue durée en reformulant la tâche comme une traduction de domaine latent conditionnée temporellement. Le cadre impose une continuité inter-blocs en propageant les latents du domaine cible à travers les frontières et utilise l'auto-conditionnement masqué du domaine cible pour rendre ce comportement apprenable.

lab NVIDIA Research · il y a 3 j · 38 vues

Les LLM égalent ou surpassent l'optimisation bayésienne pour l'optimisation des hyperparamètres

Un nouvel article explore l'utilisation de grands modèles linguistiques fondamentaux (LLM) pour automatiser l'optimisation des hyperparamètres (HPO), un processus qui repose généralement sur des approches manuelles dans des configurations à budget limité. Les auteurs ont développé une méthodologie où les LLM suggèrent des configurations d'hyperparamètres basées sur les descriptions du jeu de données et du modèle, qui sont ensuite affinées itérativement en fonction des performances du modèle.

lab NVIDIA Research · il y a 3 j · 40 vues

Source introduit la différenciation déroulée approximative pour l'attribution des données d'entraînement

Les chercheurs présentent Source, une nouvelle méthode d'attribution des données d'entraînement (TDA) qui combine l'efficacité computationnelle des fonctions d'influence avec la précision des approches basées sur le déroulement. En utilisant une formule similaire à la fonction d'influence pour approximer la différenciation déroulée, Source adresse les limitations des méthodes de différenciation implicite, telles que leur incapacité à prendre en compte le biais d'optimisation ou les pipelines multi-étapes.

lab NVIDIA Research · il y a 3 j · 12 vues

NVIDIA publie OmniDreams, un modèle de monde génératif en temps réel pour la simulation de véhicules autonomes

NVIDIA a présenté OmniDreams, un modèle de monde génératif fondamental conçu pour résoudre les goulets d'étranglement dans l'évaluation des politiques de conduite autonome au sein de simulations en boucle fermée. Entraîné en milieu et en post-entraînement à partir du modèle de diffusion Cosmos sur 21k heures de scénarios de conduite, il génère de manière autoregressive des vidéos conditionnées par les actions en temps réel.

lab Microsoft Research Blog · il y a 3 j · 12 vues

Microsoft Research présente CARE-X, un VLM unifié de radiographie thoracique avec supervision auxiliaire et mesure augmentée par outils

Microsoft Research a présenté CARE-X, un modèle de recherche conçu pour combler les lacunes des modèles vision-langage actuels en radiologie en associant la génération de rapports génératifs à des prédictions diagnostiques calibrées. Le système utilise l'apprentissage par renforcement (DAPO) pour récompenser l'exactitude clinique et associe le modèle Qwen3-VL-4B-Instruct à des outils de mesure déterministes afin d'évaluer les performances sur des pathologies nécessitant des calculs précis.

lab NVIDIA Research · il y a 4 j · 14 vues

DSTP atténue les échecs de l'élagage des tokens visuels dans le raisonnement complexe des MLLM

Les chercheurs ont identifié le Décalage de l'Information Visuelle Pertinente (RVIS) pendant le décodage comme la cause principale de l'échec des méthodes existantes d'élagage des tokens visuels dans les Modèles de Langage Large Multimodaux (MLLM). Pour remédier à cela, ils proposent l'Élagage de Tokens Aware du Décalage au Stade de Décodage (DSTP), un cadre sans entraînement qui aligne les tokens visuels avec les exigences de raisonnement changeantes.

lab NVIDIA Research · il y a 4 j · 3 vues

GenRecal distille de grands modèles vision-langage en petits par recalibration

Les chercheurs présentent GenRecal, un framework de distillation à usage général qui transfère des connaissances de grands modèles vision-langage (VLM) vers des contreparties plus petites et plus efficaces. La méthode aborde le défi des architectures VLM hétérogènes en utilisant un Recalibrator pour aligner et adapter les représentations de caractéristiques entre différents types de modèles.

lab NVIDIA Research · il y a 4 j · 9 vues

ZPPO utilise des invites au lieu de gradients pour améliorer l'entraînement de petits modèles vision-langage

Les chercheurs présentent la Zone of Proximal Policy Optimization (ZPPO), une méthode qui injecte les connaissances du professeur dans les invites plutôt que dans les gradients de politique, afin de pallier la fragilité de la distillation des connaissances et la dérive en apprentissage par renforcement. ZPPO construit des Binary Candidate-included Questions (BCQ) et des Negative Candidate-included Questions (NCQ) pour les questions difficiles, en les recirculant via un tampon de rejeu jusqu'à ce que la précision de l'étudiant s'améliore ou qu'elles soient évacuées.

lab NVIDIA Research · il y a 4 j

Hide to See introduit le masquage du préfixe de raisonnement pour la distillation VLM

Les chercheurs proposent un nouveau cadre de distillation penser-réponse qui améliore la capacité des modèles visuo-linguistiques compacts à utiliser des preuves visuelles en masquant les préfixes de raisonnement saillants. Cette approche aborde le problème de l'"oubli visuel" courant dans les traces longues de penser-réponse, où les étudiants perdent le focus sur les indices visuels pendant le raisonnement étendu.

lab NVIDIA Research · il y a 4 j · 1 vue

SpatialClaw utilise le code comme interface d'action pour le raisonnement spatial agentique

Les chercheurs proposent SpatialClaw, un framework sans entraînement qui adopte le code comme interface d'action pour améliorer le raisonnement spatial ouvert 3D et 4D dans les modèles vision-langage. Contrairement aux agents existants qui dépendent d'exécutions en un seul passage ou d'appels d'outils rigides, SpatialClaw maintient un noyau Python avec état préchargé avec des frames d'entrée et des primitives de perception.

lab NVIDIA Research · il y a 4 j · 2 vues

AXPO améliore le raisonnement agentique multimodal en comblant l'écart entre réflexion et action

Les chercheurs proposent l'Optimisation de la Politique d'Exploration Agentique (AXPO) pour combler l'écart « Thinking-Acting Gap » dans les modèles vision-langage qui nécessitent des outils externes. Cet écart entraîne les méthodes RL standard comme GRPO à tenter d'utiliser des outils sur seulement ~30% des rollouts, avec des taux d'échec élevés qui suppriment les signaux d'apprentissage.

lab NVIDIA Research · il y a 9 j · 11 vues

ROSA améliore la productivité des usines jusqu'à 12,06x grâce au service de partage de pools GPU

Les chercheurs proposent ROSA, un système de déploiement de modèle fondamental pour la robotique conçu pour les usines de robots qui va au-delà des hypothèses de calcul en périphérie pour un seul robot. Le système utilise le service de partage de pools GPU pour permettre aux flottes de robots d'accéder à des GPUs de classe serveur via le réseau.