Hardware & chips
github llama.cpp · il y a 7 j · 20 vues

llama.cpp b10994 corrige le NaN Metal dans mul_mm_id pour les grandes activations

La version llama.cpp b10994 inclut une correction pour le backend Metal qui résout les sorties NaN dans l'opération `mul_mm_id` lorsque les valeurs d'activation dépassent la plage f16. Ce défaut causait précédemment des vocabulaires entièrement NaN pour des modèles comme Mistral Small 4 lors des étapes de préremplissage de 32 tokens ou plus sur les appareils Apple Silicon.

lab NVIDIA Research · il y a 7 j · 16 vues

ShareMMU permet le partage sécurisé de la traduction d'adresses entre accélérateurs non fiables avec une faible surcharge

Les chercheurs présentent ShareMMU, une conception de IOMMU qui permet à plusieurs accélérateurs non fiables de réutiliser en toute sécurité des adresses pré-traduites dans un espace d'adresse virtuel partagé. Cette approche atténue les risques de canaux auxiliaires associés aux grands tampons de traduction partagés (TLB) tout en maintenant des performances élevées.

media Hugging Face Forums · il y a 11 j · 13 vues

Proposition pour un runtime IA indépendant du fournisseur avec exécution consciente du budget mémoire

Une proposition sur les forums de Hugging Face décrit une couche commune d'exécution GPU et de gestion de la mémoire conçue pour découpler le code applicatif des fournisseurs matériels spécifiques tels que NVIDIA, AMD et Intel. L'objectif est de permettre aux utilisateurs de spécifier un budget mémoire plutôt que de configurer manuellement des indicateurs spécifiques au backend, des cartes de périphérique ou des stratégies de déchargement.

lab NVIDIA Research · il y a 11 j · 21 vues

NVIDIA lance GPIR pour la récupération privée d'informations accélérée par GPU

Des chercheurs de NVIDIA ont présenté GPIR, un système qui accélère la Récupération Privée d'Informations (PIR) sur les GPU en traitant le calcul élevé et le trafic mémoire côté serveur inhérents aux protocoles basés sur des treillis. Le système emploie un modèle d'exécution hybride conscient des étapes qui bascule dynamiquement entre les noyaux au niveau de l'opération et au niveau de l'étape pour maximiser la réutilisation des données sur la puce.

lab NVIDIA Research · il y a 11 j · 21 vues

NVIDIA caractérise les performances et le coût de MPC et FHE pour PPML

Une nouvelle étude présente une caractérisation unifiée au niveau système du calcul multipartite sécurisé (MPC) et du chiffrement entièrement homomorphe (FHE) pour l'inférence d'apprentissage automatique préservant la confidentialité. Le travail évalue deux variantes de MPC — conversion de partage arithmétique/binaire et partage secret de fonctions — ainsi que FHE sur plusieurs modèles CNN et Transformer.

lab OpenAI News · il y a 15 j · 39 vues

Le Sol GPT-5.6 du MIT automatise l'étalonnage des puces quantiques via Codex

Beatriz Yankelevich du groupe Engineering Quantum Systems du MIT a utilisé GPT‑5.6 Sol, intégré à Codex, pour exécuter et affiner de manière autonome les mesures routinières sur des qubits supraconducteurs. Cette intégration permet à l'agent IA d'utiliser les logiciels de laboratoire, d'analyser les résultats et de décider des étapes suivantes sans surveillance humaine constante.

github llama.cpp · il y a 16 j · 44 vues

llama.cpp b10839 corrige les plantages dus aux décalages non alignés dans GET_ROWS de Vulkan

Le projet llama.cpp a publié la version b10839, qui résout des plantages critiques dans le backend Vulkan causés par des décalages non alignés lors des opérations de récupération des lignes de tenseurs. Auparavant, des modèles comme Qwen3-TTS et Qwen3-VL échouaient lorsqu'ils utilisaient `ggml_view` avec des décalages de vue non nuls, car le shader déclenchait une assertion en cas de violation d'alignement par rapport à `minStorageBufferOffsetAlignment`. Cette mise à jour implémente un support natif pour les décalages alignés dans les chemins quantifiés et non quantifiés, éliminant ainsi le besoin de replis sur le CPU.