Una extensión del navegador permite la generación local de imágenes utilizando modelos SDXL a través de WebGPU, ejecutándose en la GPU del usuario sin configuraciones externas. La herramienta admite dos modelos: SDXL-Lighting fp16 (7 GB) y una versión de 4 bits (3.6 GB), con requisitos que incluyen al menos 8 GB de VRAM para el modelo completo y un navegador con soporte de WebGPU (Chrome/Edge 122+ o Firefox más reciente).
SDXL ejecutándose localmente en el navegador con WebGPU, de código abierto
SenseNova lanza U1.5-Lite con entrenamiento experto y destilación OPD
OpenSenseNova ha lanzado la versión completa de SenseNova U1.5-Lite, un modelo de generación de imágenes que consolida expertos especializados en una única arquitectura unificada. El lanzamiento introduce aprendizaje por refuerzo orientado a tareas y aprovecha la Destilización de Parámetros Abiertos (OPD) para fusionar modelos entrenados para renderizado de texto, infografías, calidad estética y edición.
Google publica el informe técnico de DiffusionGemma
Google ha publicado un informe técnico sobre DiffusionGemma, disponible en arXiv. El documento detalla la arquitectura y las capacidades del modelo como parte de la familia Gemma.
Microsoft lanza Mage-Flow, un modelo nativo de resolución 4B para generación y edición de imágenes
Microsoft ha lanzado Mage-Flow, una pila generativa compacta de escala 4B diseñada para la generación eficiente de texto a imagen y la edición de imágenes basada en instrucciones. El sistema alcanza una calidad competitiva con el estado del arte mediante el co-diseño de un tokenizador ligero, Mage-VAE, y un Transformador de Difusión Multimodal de Resolución Nativa (NR-MMDiT).
SenseNova lanza los modelos de código abierto SenseNova-U1-8b-MoT para diseño de infografías
SenseNova ha lanzado la serie SenseNova-U1-8b-MoT, un conjunto de modelos Mixture of Transformers diseñados para generar y editar infografías densas. La última versión, Infographic V2, sirve como modelo base de 50 pasos y está licenciada bajo Apache 2.
PP-OCRv6 lanzado en Hugging Face con soporte para 50 idiomas
PP-OCRv6, un nuevo modelo de reconocimiento óptico de caracteres, ya está disponible en Hugging Face. Admite 50 idiomas y escala desde 1,5 millones hasta 34,5 millones de parámetros, ofreciendo mayor precisión y eficiencia en diversos idiomas.