Source · NVIDIA Research
lab NVIDIA Research · il y a 4 j Terminal-Bench · 68.03% · 32 vues

Mid-Harness améliore la fiabilité des actions des agents terminaux via l'augmentation du calcul au moment de l'inférence

Les chercheurs présentent Mid-Harness, une méthode qui échantillonne et vérifie les actions candidates à la frontière entre le modèle et le harnais afin d'améliorer la fiabilité de l'exécution dans les agents terminaux. Cette approche alloue du calcul au moment de l'inférence en vérifiant plusieurs options avant d'en transmettre une pour exécution, sans modifier le générateur ni le harnais.

lab NVIDIA Research · il y a 19 j · 24 vues

ShareMMU permet le partage sécurisé de la traduction d'adresses entre accélérateurs non fiables avec une faible surcharge

Les chercheurs présentent ShareMMU, une conception de IOMMU qui permet à plusieurs accélérateurs non fiables de réutiliser en toute sécurité des adresses pré-traduites dans un espace d'adresse virtuel partagé. Cette approche atténue les risques de canaux auxiliaires associés aux grands tampons de traduction partagés (TLB) tout en maintenant des performances élevées.

lab NVIDIA Research · il y a 20 j · 31 vues

FastGen-PDD introduit la distillation de décodage parallèle pour une génération rapide de vidéos et d'images

Les chercheurs introduisent la distillation de décodage parallèle (PDD), une méthode simplifiée basée sur des trajectoires pour accélérer l'inférence dans les modèles de diffusion et d'appariement de flux. Contrairement aux approches actuelles qui reposent sur une distillation de score variationnel difficile à optimiser et des pertes adversariales, PDD prédit plusieurs étapes de débruitage par évaluation du réseau.

lab NVIDIA Research · il y a 20 j · 36 vues

Nvidia introduit des modèles étendus d'erreurs de détecteurs pour composer les erreurs de circuits quantiques

Le chercheur de Nvidia N. Horrocks présente les modèles étendus d'erreurs de détecteurs (EDEMs) conçus pour gérer les programmes quantiques tolérants aux pannes avec des circuits stabilisateurs et des erreurs de Pauli stochastiques. Ces modèles permettent à l'analyse des erreurs de se composer séquentiellement et en parallèle, reflétant la structure des réalisations physiques du circuit.

lab NVIDIA Research · il y a 23 j · 32 vues

Privatar permet une réalité virtuelle multi-utilisateurs évolutive et préservant la vie privée grâce au déchargement sécurisé

Les chercheurs présentent Privatar, un cadre qui décharge la reconstruction d'avatars des casques vers des appareils locaux non fiables tout en se protégeant contre l'interception des données. Le système exploite les connaissances spécifiques au domaine de la reconstruction d'avatars pour obtenir un déchargement prouvé privé avec un coût minimal en termes de performances.

lab NVIDIA Research · il y a 23 j · 36 vues

NVIDIA lance GPIR pour la récupération privée d'informations accélérée par GPU

Des chercheurs de NVIDIA ont présenté GPIR, un système qui accélère la Récupération Privée d'Informations (PIR) sur les GPU en traitant le calcul élevé et le trafic mémoire côté serveur inhérents aux protocoles basés sur des treillis. Le système emploie un modèle d'exécution hybride conscient des étapes qui bascule dynamiquement entre les noyaux au niveau de l'opération et au niveau de l'étape pour maximiser la réutilisation des données sur la puce.

lab NVIDIA Research · il y a 23 j · 37 vues

NVIDIA caractérise les performances et le coût de MPC et FHE pour PPML

Une nouvelle étude présente une caractérisation unifiée au niveau système du calcul multipartite sécurisé (MPC) et du chiffrement entièrement homomorphe (FHE) pour l'inférence d'apprentissage automatique préservant la confidentialité. Le travail évalue deux variantes de MPC — conversion de partage arithmétique/binaire et partage secret de fonctions — ainsi que FHE sur plusieurs modèles CNN et Transformer.

lab NVIDIA Research · il y a 23 j · 27 vues

NVIDIA propose des défenses au niveau du système contre l'injection indirecte de prompts dans les agents IA

Un document de position des chercheurs de NVIDIA décrit une vision pour sécuriser les agents IA contre les attaques par injection indirecte de prompts, où des instructions malveillantes intégrées dans des données non fiables déclenchent des actions dangereuses. Les auteurs soutiennent qu'une défense efficace nécessite de dépasser les correctifs isolés du modèle au profit d'architectures complètes au niveau du système.

lab NVIDIA Research · il y a 23 j · 23 vues

ReasoningBomb provoque un raisonnement pathologiquement long dans les grands modèles de raisonnement

Des chercheurs ont formalisé des attaques par déni de service au moment de l'inférence (PI-DoS) qui exploitent le coût computationnel élevé du raisonnement explicite multi-étapes dans les Grands Modèles de Raisonnement (LRMs). Ils présentent ReasoningBomb, un cadre basé sur l'apprentissage par renforcement qui entraîne un attaquant à générer des invites naturelles courtes qui poussent les modèles victimes vers des traces de raisonnement pathologiquement longues et souvent non terminantes.

lab NVIDIA Research · il y a 23 j · 19 vues

ReasAlign utilise le raisonnement pour défendre les agents LLM contre l'injection de prompts

Les chercheurs ont présenté ReasAlign, une solution au niveau du modèle conçue pour améliorer l'alignement de sécurité des grands modèles de langage (LLM) contre les attaques par injection indirecte de prompts. L'approche intègre des étapes de raisonnement structurées pour analyser les requêtes utilisateur et détecter les instructions conflictuelles, garantissant la continuité des tâches prévues par l'utilisateur.