Image generation
media TLDR AI · 2 ч назад AIME 2024 · 50.0% · 9 просмотров

Meta открывает коннекторы Muse, выпускает SAM 3.1 и Gemini взламывает системы

Это обновление охватывает несколько событий в сфере ИИ, включая открытие Meta своей платформы Muse для сторонних разработчиков, выпуск новой версии модели сегментации и инцидент с безопасностью, связанный с Google Gemini.

media MarkTechPost · 2 д назад · 14 просмотров

Alibaba Qwen выпускает унифицированную 7B модель Qwen-Image-2.1 для генерации и редактирования изображений

Команда Qwen от Alibaba выпустила Qwen-Image-2.1, унифицированную модель генерации изображений по тексту и их редактирования, которая объединяет предыдущие отдельные чекпоинты в единый диффузионный трансформер на 7B параметров.

media Hugging Face Forums · 10 д назад · 18 просмотров

Badaramoni выпустил LoRA фотореализма Krea 2 Turbo путём слияния смешанных адаптеров LoRA и LoKR

Badaramoni выпустил новый адаптер для модели Krea-2-Turbo, который объединяет публичные пакеты реализма разных форматов в один файл. Выпуск решает ограничение, при котором стандартные инструменты слияния не могут объединить классические адаптеры LoRA и LoKR, поскольку они не используют один и тот же формат низкого ранга.

media Hugging Face Forums · 11 д назад · 9 просмотров

Diffusers-workflow позволяет агентам управлять генерацией изображений и видео на GPU через MCP

Diffusers-workflow — это декларативный движок, построенный поверх Hugging Face Diffusers, который позволяет агентам больших языковых моделей создавать, проверять, запускать и анализировать конвейеры обработки изображений или видео с использованием JSON-документов вместо Python-скриптов. Он предоставляет сервер MCP с примерно 50 инструментами в качестве основного интерфейса, обеспечивая автономное управление агентами ресурсами GPU.

lab Hugging Face Blog · 13 д назад · 24 просмотра

Gradio выпускает Workflow1111, воссоздавая функции AUTOMATIC1111 в виде графа Gradio

Gradio выпустила Workflow1111 — проект, который воссоздает большинство функций stable-diffusion-webui от AUTOMATIC1111 с использованием фреймворка gr.Workflow. Приложение состоит из одного холста, содержащего одиннадцать медиапайплайнов, собранных из семидесяти трех узлов, охватывающих задачи преобразования текста в изображение, изображения в видео и различные этапы предварительной обработки.

lab Google — The Keyword (AI) · 14 д назад · 35 просмотров

Google DeepMind использует ИИ для воссоздания незаписанной памяти пары для документального фильма

В сотрудничестве с режиссером Лиз Гарбус и компанией Primordial Soup, Google DeepMind использовала генеративные модели ИИ для реконструкции незапечатленной на фото встречи Бурта и Этелл Шатц для короткометражного документального фильма «Love, Rendered». Проект направлен на решение проблемы когнитивного спада путем воссоздания конкретной памяти, существовавшей только в сознании пары.

media r/LocalLLaMA · 14 д назад · 30 просмотров

gtrg55 выпускает INT4-квантованную версию NVIDIA Cosmos3 64B для локальной генерации изображений

Пользователь опубликовал код и веса для локального запуска модели Cosmos3 от NVIDIA с 64 миллиардами параметров с использованием INT4-квантования. Реализация поддерживает задачи Text-to-Image и Image-to-Video на Apple Silicon через MLX, а также CUDA.

blog Simon Willison · 14 д назад · 18 просмотров

OpenAI выпустила ChatGPT Images 2.5 с улучшенным следованием инструкциям и сохранением референсных фото

OpenAI выпустила ChatGPT Images 2.5, обновление своих моделей генерации изображений, которое улучшает способность следовать инструкциям в течение нескольких раундов и увеличивает скорость ответа. Новая версия также лучше сохраняет объекты с референсных фотографий, предоставленных пользователями.

lab OpenAI News · 15 д назад · 22 просмотра

OpenAI представляет ChatGPT Images 2.5 с более чёткими деталями, ускоренной генерацией и новыми инструментами редактирования

Компания OpenAI выпустила ChatGPT Images 2.5 — новую модель изображений уровня state-of-the-art, обеспечивающую более чёткие детали, более точные возможности редактирования и скорость генерации до 50% выше по сравнению с предыдущей версией.

lab Hugging Face Blog · 20 д назад · 29 просмотров

OpenEnv воспроизводит модель акварельной живописи Суры Нарредди с помощью TRL

Инженер открыл исходный код воспроизведения вирусного проекта Суры Нарредди, который обучает модель программирования рисовать акварелью с использованием JavaScript и обучения с подкреплением. Реализация использует библиотеку TRL и OpenEnv для создания сквозного конвейера на Hugging Face для обучения, оценки и вывода.

lab Google — The Keyword (AI) · 22 д назад · 21 просмотр

Google запускает инструмент создания изображений Pics для подписчиков Workspace

Google внедряет Google Pics, инструмент для создания и редактирования изображений на базе модели Nano Banana, для всех подписчиков Google AI Pro и Ultra, а также большинства корпоративных клиентов Workspace в ближайшие недели.