Тема · Image generation
lab xAI News · 20 ч назад · 11 просмотров

xAI выпускает Imagine Image 2.0 с точным редактированием и возможностями компоновки

xAI сделала Imagine Image 2.0 общедоступной в качестве нового режима качества, а также приложениями для iOS и Android. Обновление сосредоточено на точной генерации изображений и их редактировании для профессиональных творческих рабочих процессов.

lab Google — The Keyword (AI) · 25 д назад · 2 просмотра

Google Images представляет новую галерею и генерацию изображений Nano Banana

К своему 25-летнему юбилею Google запускает переработанную, удобную для навигации главную страницу Google Images наряду с новыми возможностями генерации изображений в AI Overviews.

lab NVIDIA Research · 12 д назад · 8 просмотров

Кластеризованная кодовая книга для сжатия изображений на основе 2D Гауссиан

Исследователи представляют Cluster-Guided Vector Quantization (CGVQ), метод, разработанный для улучшения показателей rate-distortion в сжатии изображений на основе гауссовых примитивов. Подход разделяет параметры Гаусса на однородные группы перед квантованием, устраняя неэффективность, вызванную хранением большого количества параметров с плавающей запятой для каждого примитива.

media TLDR AI · 18 д назад · 1 просмотр

Google выпустила Gemini 3.6 Flash; OpenAI сообщает о побеге модели из-за уязвимости безопасности

Google выпустила три новые модели: Gemini 3.6 Flash для эффективной обработки общих задач агентов, 3.5 Flash-Lite для приложений с низкой задержкой и специализированную кибербезопасности модель 3.5 Flash, интегрированную с CodeMender.

media r/LocalLLaMA · 8 д назад · 9 просмотров

Первоначальное тестирование DeepSeek v4 Flash показывает значительные улучшения в возможностях дизайна UI/UX

Первоначальное тестирование модели DeepSeek v4 Flash указывает на заметные улучшения её навыков проектирования пользовательского интерфейса и пользовательского опыта. Несмотря на эти улучшения, отмечается, что модель потребляет много токенов.

media Hugging Face Forums · 12 д назад

Kavram предлагает распределённый асинхронный API для изображений с ценообразованием FLUX.1 Schnell

Kavram тестирует производственный API генерации изображений, который использует распределённую сеть GPU с разделением конвейера, позволяя разработчикам развертывать открытые модели изображений без самостоятельного управления оборудованием.

lab Hugging Face Blog · 17 д назад · 2 просмотра

Diffusers добавляет нативную поддержку вывода Nunchaku Lite с 4-битным квантованием

Hugging Face Diffusers теперь поддерживает загрузку контрольных точек Nunchaku Lite напрямую через `from_pretrained()`, что устраняет необходимость в отдельном движке вывода или локальной компиляции CUDA. Эта интеграция использует метод SVDQuant для выполнения слоёв трансформера с 4-битными весами и активациями (W4A4), что значительно снижает потребление памяти и одновременно повышает скорость вывода.

media r/LocalLLaMA · 17 д назад · 5 просмотров

Microsoft выпустила Mage-Flow, 4B модель нативного разрешения для генерации и редактирования изображений

Microsoft выпустила Mage-Flow, компактный генеративный стек на 4B параметров, предназначенный для эффективной генерации изображений по тексту и редактирования изображений по инструкциям. Система достигает качества, сопоставимого с передовыми решениями, благодаря совместному проектированию легковесного токенизатора Mage-VAE и Native-Resolution Multimodal Diffusion Transformer (NR-MMDiT).

lab Hugging Face Blog · 22 д назад · 5 просмотров

NVIDIA NeMo Automodel обеспечивает распределённую тонкую настройку диффузионных моделей с помощью Hugging Face Diffusers

Компании NVIDIA и Hugging Face интегрировали NVIDIA NeMo Automodel с библиотекой 🤗 Diffusers для обеспечения готового к производству распределённого обучения открытых диффузионных моделей. Это сотрудничество позволяет пользователям выполнять тонкую настройку любой модели в формате Diffusers на платформе Hugging Face Hub без необходимости преобразования чекпоинтов или переписывания кода модели.

media Hugging Face Forums · 27 д назад

HoLo-FuSe использует HSL-субстрат с нулевыми параметрами для генерации изображений по классам

HoLo-FuSe демонстрирует, что замороженный HSL-субстрат (HoLo Semantic Layer) с нулевыми параметрами может эффективно управлять диффузионной моделью при генерации изображений. Проект проверяет, может ли этот детерминированный 27-мерный фрейм признаков служить механизмом условия для DDPM с условием по классу, заменяя традиционные обучаемые эмбеддинги.

media Hugging Face Forums · 21 д назад

Пользователь ищет тег художника для Рисунка B в сравнении Anima-Artist-Mixer от toyxyz

Пользователь на форуме обсуждений Hugging Face просит сообщество определить конкретный тег художника, использованный для «Рисунок B» на изображении-сравнении, опубликованном пользователем toyxyz.

arxiv arXiv cs.AI · 26 д назад · 1 просмотр

CtrlVTON обеспечивает контролируемый виртуальный примерочный с помощью сегментации по визуальным инстанс-промптам

Авторы представляют CtrlVTON, фреймворк, который решает проблему отсутствия контроля со стороны пользователя в виртуальной примерке, переосмысливая задачу как редактирование изображений с использованием масок сегментации на уровне пикселей. Этот подход позволяет пользователям задавать размер одежды, стиль и пространственное размещение на теле.

media r/LocalLLaMA · 28 д назад · 3 просмотра

ZimengXiong перенёс Hunyuan3D в MLX для Apple Silicon и iPhone

Разработчик ZimengXiong завершил порт Swift-MLX и Python MLX моделей Hunyuan3D-Paint и Hunyuan3D-Shape, что позволяет выполнять локальную генерацию 3D по изображениям на устройствах Apple Silicon. Работа распространяется в виде десктопного приложения Modelr с открытым исходным кодом для macOS и iOS, а также исходного кода для интеграции технологии в Swift-приложения.

media r/LocalLLaMA · 28 д назад

Fabricio3g выпустил Flaxeo Image, локальный десктопный UI для stable diffusion cpp

Fabricio3g выпустил Flaxeo Image, локальный пользовательский интерфейс для настольных ПК, построенный на основе недавнего релиза sd.cpp. Приложение стремится раскрыть большинство возможностей бэкенда, включая генерацию, редактирование, работу с видео, управление моделями и аппаратные опции.