Sujet · Image generation
lab NVIDIA Research · il y a 7 h · 2 vues

Nvidia présente FusionRelight pour le re-éclairage de portraits en temps réel via une fusion hybride de connaissances de domaine

Des chercheurs de Nvidia ont présenté FusionRelight, une méthode de re-éclairage de portraits qui combine un transfert d'illumination physiquement plausible avec la préservation de l'identité et une inférence compacte en temps réel. L'approche utilise la Fusion Hybride de Connaissances de Domaine (HDKF), un cadre d'entraînement qui distille les a priori de physique, de réflectance et de réalisme à partir de données synthétiques, One-Light-at-a-Time (OLAT) et in-the-wild dans un modèle étudiant.

lab NVIDIA Research · il y a 18 j · 13 vues

Quantification de codebook clusterisé pour la compression d'images basée sur des Gaussiennes 2D

Les chercheurs présentent Cluster-Guided Vector Quantization (CGVQ), une méthode conçue pour améliorer les performances taux-distorsion de la compression d'images basée sur des primitives gaussiennes. L'approche partitionne les paramètres de Gaussienne en groupes homogènes avant la quantification, traitant l'inefficacité causée par le stockage de grands nombres de paramètres à virgule flottante par primitive.

lab Hugging Face Blog · il y a 23 j · 3 vues

Diffusers ajoute le support natif de l'inférence Nunchaku Lite 4-bit

Hugging Face Diffusers prend désormais en charge le chargement natif des points de contrôle Nunchaku Lite via `from_pretrained()`, éliminant ainsi le besoin d'un moteur d'inférence séparé ou d'une compilation CUDA locale. Cette intégration utilise la méthode SVDQuant pour exécuter les couches transformateur avec des poids et activations en 4 bits (W4A4), réduisant considérablement l'utilisation de la mémoire tout en améliorant la vitesse d'inférence.

media r/LocalLLaMA · il y a 23 j · 6 vues

Microsoft publie Mage-Flow, un modèle natif de 4B pour la génération et l'édition d'images

Microsoft a publié Mage-Flow, une pile générative compacte à échelle 4B conçue pour la génération texte-vers-image efficace et l'édition d'images basée sur des instructions. Le système atteint une qualité compétitive avec les meilleurs résultats grâce à la co-conception d'un tokenizeur léger, Mage-VAE, et d'un Transformateur de Diffusion Multimodale à Résolution Native (NR-MMDiT).

lab Hugging Face Blog · il y a 28 j · 5 vues

NVIDIA NeMo Automodel permet le fine-tuning distribué de modèles de diffusion avec Hugging Face Diffusers

NVIDIA et Hugging Face ont intégré NVIDIA NeMo Automodel à la bibliothèque 🤗 Diffusers pour fournir un entraînement distribué de qualité production pour les modèles de diffusion open-source. Cette collaboration permet aux utilisateurs de fine-tuner n'importe quel modèle au format Diffusers sur le Hub Hugging Face sans nécessiter de conversion de checkpoints ni de réécriture du code du modèle.