PP-OCRv6, новый модель распознавания текста, теперь доступен на Hugging Face. Он поддерживает 50 языков и масштабируется от 1,5 миллионов до 34,5 миллионов параметров, обеспечивая повышенную точность и эффективность при работе с разными языками.
PP-OCRv6 выпущен на Hugging Face с поддержкой 50 языков
Microsoft выпустила Mage-Flow, 4B модель нативного разрешения для генерации и редактирования изображений
Microsoft выпустила Mage-Flow, компактный генеративный стек на 4B параметров, предназначенный для эффективной генерации изображений по тексту и редактирования изображений по инструкциям. Система достигает качества, сопоставимого с передовыми решениями, благодаря совместному проектированию легковесного токенизатора Mage-VAE и Native-Resolution Multimodal Diffusion Transformer (NR-MMDiT).
SenseNova выпустила открытые модели SenseNova-U1-8b-MoT для инфографики
SenseNova выпустила серию SenseNova-U1-8b-MoT, набор моделей Mixture of Transformers, предназначенных для генерации и редактирования плотной инфографики. Последняя версия Infographic V2 служит базовой моделью на 50 шагов и лицензирована под Apache 2.
SDXL работает локально в браузере на WebGPU, открытый исходный код
Браузерное расширение позволяет генерировать изображения локально с использованием моделей SDXL через WebGPU, работающих на видеокарте пользователя без дополнительных настроек. Инструмент поддерживает два варианта: SDXL-Lighting fp16 (7 ГБ) и версия 4-бит (3,6 ГБ), при этом требуется не менее 8 ГБ VRAM для полной модели и браузер с поддержкой WebGPU (Chrome/Edge 122+ или последняя версия Firefox).
Лучшая открытая модель визуального анализа, работающая на RTX 6000 Pro
Пользователь ищет текущую лучшую открытую модель визуального анализа, которая может работать на RTX 6000 Pro для распознавания текста и классификации исторических сканированных документов. Он отмечает, что Gemma 4 31B работает хорошо и превосходит визуальный декодер Qwen 3.6, и просит рекомендации по моделям за пределами этой модели.
DreamReasoner-8B: обучение куррикулумом по размеру блоков для рассуждения на основе диффузии
DreamReasoner-8B — это открытый блок-модель диффузии, демонстрирующая сильное рассуждение в длинной цепи мыслей. Систематическое исследование показывает, что малые размеры обучающих блоков сохраняют эффективность рассуждения, в то время как большие размеры снижают производительность. Обучение куррикулумом по размеру блоков постепенно переходит от мелких к крупным блокам, обеспечивая устойчивое и обобщаемое рассуждение в различных условиях инференса, с результатами, конкурирующими с Qwen3-8B на математических и кодовых тестах.