Image generation
lab NVIDIA Research · hace 12 d · 8 vistas

Cuantización de código agrupado para compresión de imágenes basada en Gaussiana 2D

Los investigadores presentan Cluster-Guided Vector Quantization (CGVQ), un método diseñado para mejorar el rendimiento de tasa-distorsión en la compresión de imágenes basada en primitivas gaussianas. El enfoque particiona los parámetros de Gaussiana en grupos homogéneos antes de la cuantización, abordando la ineficiencia causada por almacenar grandes cantidades de parámetros de punto flotante por primitiva.

lab Hugging Face Blog · hace 17 d · 2 vistas

Diffusers añade soporte nativo para inferencia Nunchaku Lite de 4 bits

Hugging Face Diffusers ahora admite la carga de checkpoints de Nunchaku Lite de forma nativa mediante `from_pretrained()`, eliminando la necesidad de un motor de inferencia separado o compilación local de CUDA. Esta integración utiliza el método SVDQuant para ejecutar capas transformadoras con pesos y activaciones de 4 bits (W4A4), reduciendo significativamente el uso de memoria mientras mejora la velocidad de inferencia.

media r/LocalLLaMA · hace 17 d · 5 vistas

Microsoft lanza Mage-Flow, un modelo nativo de resolución 4B para generación y edición de imágenes

Microsoft ha lanzado Mage-Flow, una pila generativa compacta de escala 4B diseñada para la generación eficiente de texto a imagen y la edición de imágenes basada en instrucciones. El sistema alcanza una calidad competitiva con el estado del arte mediante el co-diseño de un tokenizador ligero, Mage-VAE, y un Transformador de Difusión Multimodal de Resolución Nativa (NR-MMDiT).

lab Hugging Face Blog · hace 23 d · 5 vistas

NVIDIA NeMo Automodel permite el ajuste fino distribuido de modelos de difusión con Hugging Face Diffusers

NVIDIA y Hugging Face han integrado NVIDIA NeMo Automodel con la biblioteca 🤗 Diffusers para proporcionar entrenamiento distribuido de nivel de producción para modelos de difusión de código abierto. Esta colaboración permite a los usuarios ajustar cualquier modelo en formato Diffusers en el Hub de Hugging Face sin requerir conversión de puntos de control ni reescritura del código del modelo.

media Hugging Face Forums · hace 28 d

HoLo-FuSe utiliza sustrato HSL de 0 parámetros para generación de imágenes condicionales por clase

HoLo-FuSe demuestra que un sustrato byte de HoLo Semantic Layer (HSL) congelado y de cero parámetros puede condicionar eficazmente un modelo de difusión para la generación de imágenes. El proyecto prueba si este marco de características determinista de 27-D puede servir como mecanismo de condicionamiento para un DDPM condicional por clase, reemplazando los embeddings aprendidos tradicionales.