Image generation
lab NVIDIA Research · il y a 12 j · 8 vues

Quantification de codebook clusterisé pour la compression d'images basée sur des Gaussiennes 2D

Les chercheurs présentent Cluster-Guided Vector Quantization (CGVQ), une méthode conçue pour améliorer les performances taux-distorsion de la compression d'images basée sur des primitives gaussiennes. L'approche partitionne les paramètres de Gaussienne en groupes homogènes avant la quantification, traitant l'inefficacité causée par le stockage de grands nombres de paramètres à virgule flottante par primitive.

lab Hugging Face Blog · il y a 17 j · 2 vues

Diffusers ajoute le support natif de l'inférence Nunchaku Lite 4-bit

Hugging Face Diffusers prend désormais en charge le chargement natif des points de contrôle Nunchaku Lite via `from_pretrained()`, éliminant ainsi le besoin d'un moteur d'inférence séparé ou d'une compilation CUDA locale. Cette intégration utilise la méthode SVDQuant pour exécuter les couches transformateur avec des poids et activations en 4 bits (W4A4), réduisant considérablement l'utilisation de la mémoire tout en améliorant la vitesse d'inférence.

media r/LocalLLaMA · il y a 17 j · 5 vues

Microsoft publie Mage-Flow, un modèle natif de 4B pour la génération et l'édition d'images

Microsoft a publié Mage-Flow, une pile générative compacte à échelle 4B conçue pour la génération texte-vers-image efficace et l'édition d'images basée sur des instructions. Le système atteint une qualité compétitive avec les meilleurs résultats grâce à la co-conception d'un tokenizeur léger, Mage-VAE, et d'un Transformateur de Diffusion Multimodale à Résolution Native (NR-MMDiT).

lab Hugging Face Blog · il y a 23 j · 5 vues

NVIDIA NeMo Automodel permet le fine-tuning distribué de modèles de diffusion avec Hugging Face Diffusers

NVIDIA et Hugging Face ont intégré NVIDIA NeMo Automodel à la bibliothèque 🤗 Diffusers pour fournir un entraînement distribué de qualité production pour les modèles de diffusion open-source. Cette collaboration permet aux utilisateurs de fine-tuner n'importe quel modèle au format Diffusers sur le Hub Hugging Face sans nécessiter de conversion de checkpoints ni de réécriture du code du modèle.

media Hugging Face Forums · il y a 28 j

HoLo-FuSe utilise un substrat HSL à 0 paramètre pour la génération d'images conditionnées par classe

HoLo-FuSe démontre qu'un substrat byte HoLo Semantic Layer (HSL) gelé et à zéro paramètre peut efficacement conditionner un modèle de diffusion pour la génération d'images. Le projet teste si cette trame de caractéristiques déterministe 27-D peut servir de mécanisme de conditionnement pour un DDPM conditionné par classe, remplaçant les embeddings appris traditionnels.

media r/LocalLLaMA · il y a 28 j · 3 vues

ZimengXiong porte Hunyuan3D sur MLX pour Apple Silicon et iPhone

Le développeur ZimengXiong a terminé le portage des modèles Hunyuan3D-Paint et Hunyuan3D-Shape vers Swift-MLX et Python MLX, permettant la génération locale d'images en 3D sur les appareils Apple Silicon. Le travail est distribué sous forme d'application de bureau open-source Modelr pour macOS et iOS, ainsi que du code source pour intégrer cette technologie dans des applications Swift.