Браузерное расширение позволяет генерировать изображения локально с использованием моделей SDXL через WebGPU, работающих на видеокарте пользователя без дополнительных настроек. Инструмент поддерживает два варианта: SDXL-Lighting fp16 (7 ГБ) и версия 4-бит (3,6 ГБ), при этом требуется не менее 8 ГБ VRAM для полной модели и браузер с поддержкой WebGPU (Chrome/Edge 122+ или последняя версия Firefox).
SDXL работает локально в браузере на WebGPU, открытый исходный код
Microsoft выпустила Mage-Flow, 4B модель нативного разрешения для генерации и редактирования изображений
Microsoft выпустила Mage-Flow, компактный генеративный стек на 4B параметров, предназначенный для эффективной генерации изображений по тексту и редактирования изображений по инструкциям. Система достигает качества, сопоставимого с передовыми решениями, благодаря совместному проектированию легковесного токенизатора Mage-VAE и Native-Resolution Multimodal Diffusion Transformer (NR-MMDiT).
SenseNova выпустила открытые модели SenseNova-U1-8b-MoT для инфографики
SenseNova выпустила серию SenseNova-U1-8b-MoT, набор моделей Mixture of Transformers, предназначенных для генерации и редактирования плотной инфографики. Последняя версия Infographic V2 служит базовой моделью на 50 шагов и лицензирована под Apache 2.
PP-OCRv6 выпущен на Hugging Face с поддержкой 50 языков
PP-OCRv6, новый модель распознавания текста, теперь доступен на Hugging Face. Он поддерживает 50 языков и масштабируется от 1,5 миллионов до 34,5 миллионов параметров, обеспечивая повышенную точность и эффективность при работе с разными языками.
Лучшая открытая модель визуального анализа, работающая на RTX 6000 Pro
Пользователь ищет текущую лучшую открытую модель визуального анализа, которая может работать на RTX 6000 Pro для распознавания текста и классификации исторических сканированных документов. Он отмечает, что Gemma 4 31B работает хорошо и превосходит визуальный декодер Qwen 3.6, и просит рекомендации по моделям за пределами этой модели.
DreamReasoner-8B: обучение куррикулумом по размеру блоков для рассуждения на основе диффузии
DreamReasoner-8B — это открытый блок-модель диффузии, демонстрирующая сильное рассуждение в длинной цепи мыслей. Систематическое исследование показывает, что малые размеры обучающих блоков сохраняют эффективность рассуждения, в то время как большие размеры снижают производительность. Обучение куррикулумом по размеру блоков постепенно переходит от мелких к крупным блокам, обеспечивая устойчивое и обобщаемое рассуждение в различных условиях инференса, с результатами, конкурирующими с Qwen3-8B на математических и кодовых тестах.