PP-OCRv6, un nuevo modelo de reconocimiento óptico de caracteres, ya está disponible en Hugging Face. Admite 50 idiomas y escala desde 1,5 millones hasta 34,5 millones de parámetros, ofreciendo mayor precisión y eficiencia en diversos idiomas.
PP-OCRv6 lanzado en Hugging Face con soporte para 50 idiomas
Microsoft lanza Mage-Flow, un modelo nativo de resolución 4B para generación y edición de imágenes
Microsoft ha lanzado Mage-Flow, una pila generativa compacta de escala 4B diseñada para la generación eficiente de texto a imagen y la edición de imágenes basada en instrucciones. El sistema alcanza una calidad competitiva con el estado del arte mediante el co-diseño de un tokenizador ligero, Mage-VAE, y un Transformador de Difusión Multimodal de Resolución Nativa (NR-MMDiT).
SenseNova lanza los modelos de código abierto SenseNova-U1-8b-MoT para diseño de infografías
SenseNova ha lanzado la serie SenseNova-U1-8b-MoT, un conjunto de modelos Mixture of Transformers diseñados para generar y editar infografías densas. La última versión, Infographic V2, sirve como modelo base de 50 pasos y está licenciada bajo Apache 2.
SDXL ejecutándose localmente en el navegador con WebGPU, de código abierto
Una extensión del navegador permite la generación local de imágenes utilizando modelos SDXL a través de WebGPU, ejecutándose en la GPU del usuario sin configuraciones externas. La herramienta admite dos modelos: SDXL-Lighting fp16 (7 GB) y una versión de 4 bits (3.6 GB), con requisitos que incluyen al menos 8 GB de VRAM para el modelo completo y un navegador con soporte de WebGPU (Chrome/Edge 122+ o Firefox más reciente).
Mejor modelo de visión de código abierto ejecutable en RTX 6000 Pro
El usuario busca el mejor modelo de visión de código abierto actual que pueda ejecutarse en una RTX 6000 Pro para OCR y clasificación de documentos escaneados históricos. Señala que Gemma 4 31B funciona bien y es mejor que el codificador de visión de Qwen 3.6, pidiendo recomendaciones más allá de este modelo.
DreamReasoner-8B: Aprendizaje de currículo por tamaño de bloque para razonamiento con difusión
DreamReasoner-8B es un modelo de difusión por bloques de código abierto que demuestra una sólida capacidad de razonamiento en cadenas largas de pensamiento. Un estudio sistemático muestra que los tamaños pequeños de bloques de entrenamiento preservan la efectividad del razonamiento, mientras que los tamaños grandes degradan el rendimiento. El aprendizaje de currículo por tamaño de bloque transita gradualmente el entrenamiento desde bloques finos hasta gruesos, permitiendo un razonamiento robusto y generalizable en diferentes configuraciones de inferencia, con resultados competitivos frente a Qwen3-8B en benchmarks matemáticos y de código.