Sujet · Inference efficiency
lab Microsoft Research Blog · il y a 7 j · 28 vues

Microsoft Research montre que le déchargement de l'inférence d'IA physique améliore les performances et l'autonomie des robots

Microsoft Research remet en question l'hypothèse selon laquelle l'inférence d'IA physique doit s'exécuter exclusivement sur les GPU embarqués des robots, démontrant que le déchargement vers une infrastructure edge ou cloud améliore considérablement les charges de travail de manipulation mobile. Leur étude systématique des charges de travail robotiques révèle que la dépendance au calcul embarqué limite les performances, l'autonomie et l'évolutivité.

lab NVIDIA Research · il y a 16 j · 20 vues

FastGen-PDD introduit la distillation de décodage parallèle pour une génération rapide de vidéos et d'images

Les chercheurs introduisent la distillation de décodage parallèle (PDD), une méthode simplifiée basée sur des trajectoires pour accélérer l'inférence dans les modèles de diffusion et d'appariement de flux. Contrairement aux approches actuelles qui reposent sur une distillation de score variationnel difficile à optimiser et des pertes adversariales, PDD prédit plusieurs étapes de débruitage par évaluation du réseau.

lab NVIDIA Research · il y a 19 j · 28 vues

NVIDIA lance GPIR pour la récupération privée d'informations accélérée par GPU

Des chercheurs de NVIDIA ont présenté GPIR, un système qui accélère la Récupération Privée d'Informations (PIR) sur les GPU en traitant le calcul élevé et le trafic mémoire côté serveur inhérents aux protocoles basés sur des treillis. Le système emploie un modèle d'exécution hybride conscient des étapes qui bascule dynamiquement entre les noyaux au niveau de l'opération et au niveau de l'étape pour maximiser la réutilisation des données sur la puce.

lab NVIDIA Research · il y a 19 j · 26 vues

NVIDIA caractérise les performances et le coût de MPC et FHE pour PPML

Une nouvelle étude présente une caractérisation unifiée au niveau système du calcul multipartite sécurisé (MPC) et du chiffrement entièrement homomorphe (FHE) pour l'inférence d'apprentissage automatique préservant la confidentialité. Le travail évalue deux variantes de MPC — conversion de partage arithmétique/binaire et partage secret de fonctions — ainsi que FHE sur plusieurs modèles CNN et Transformer.

lab OpenAI News · il y a 19 j · 37 vues

OpenAI porte le service de stockage Habitat à 70 millions de requêtes par seconde

OpenAI a mis à l'échelle sa plateforme de stockage en ligne interne, Habitat, pour gérer plus de 70 millions de requêtes par seconde pour plus d'un milliard d'utilisateurs hebdomadaires de ChatGPT dans près de 40 régions géographiques. Le système sert désormais plus de 500 pétaoctets de données, évoluant d'une simple bibliothèque cliente Python en un service distribué complexe.

media MarkTechPost · il y a 20 j · 55 vues

DeepSeek publie DeepSeek-V4.1-Flash avec un contexte de 1M et un cache KV FP4

DeepSeek AI a publié DeepSeek-V4.1-Flash, un modèle Mixture-of-Experts multimodal disposant d'une fenêtre de contexte de 1 million de tokens et d'un cache KV FP4 qui réduit l'empreinte globale du cache à 890 octets par token. Le modèle utilise une architecture encodeur-décodeur causal et Compressed Sparse Attention 2 (CSA2) pour réduire considérablement les besoins en mémoire tout en maintenant les performances.

github llama.cpp · il y a 8 h · 1 vue

llama.cpp b11282 définit CUDA_ARCH pour les passes de périphérique MUSA

Le projet llama.cpp a publié la compilation b11282, qui inclut une correction pour définir la macro `CUDA_ARCH` pour les passes de périphérique MUSA. Auparavant, l'en-tête du fournisseur MUSA ne définissait pas cette variable, ce qui faisait que les tests d'architecture dans les sources partagées ggml-cuda étaient évalués à zéro et entraînaient des corps de noyau vides.

arxiv arXiv cs.CL · il y a 16 h · 1 vue

Les modèles de langage contextuels gèrent le contexte nativement comme des fichiers modifiables

Des chercheurs présentent les Modèles de Langage Contextuels (CLM), une nouvelle architecture qui traite la fenêtre de contexte du modèle comme un fichier modifiable, permettant au modèle d'effectuer des mises à jour non restreintes de sa propre mémoire. Cette approche déplace la gestion du contexte du contrôle externe vers le comportement intrinsèque du modèle, permettant l'apprentissage en contexte et paramétrique des stratégies de gestion du contexte.

media Hugging Face Forums · il y a 18 h · 1 vue

AI Hardware Fit relie les besoins en VRAM des modèles à la sélection de GPU

Le créateur d'AI Hardware Fit a publié un outil navigateur gratuit et open-source conçu pour aider les utilisateurs à déterminer si un modèle local tient sur leur GPU et à comparer les options matérielles appropriées. L'outil s'attaque à la complexité liée au regroupement des fichiers de modèle, de la quantification, de la longueur du contexte et du support d'exécution provenant de sources disparates.