Тема · Video generation
lab xAI News · 8 д назад · 5 просмотров

xAI добавила ссылки на изображения и голос в Imagine Video 1.5

xAI обновила свою модель Imagine Video 1.5 для поддержки текстовых, изображений и голосовых ссылок, что позволяет пользователям генерировать видео разрешением до 1080p. Обновление обеспечивает согласованность персонажей путем фиксации лиц и голосов между сценами, поддерживая до семи ссылок на одну генерацию.

lab Google — The Keyword (AI) · 23 д назад · 6 просмотров

Google добавила Gemini Omni и персональные аватары в Google Vids

Google выпустила два новых обновления для Google Vids: интеграцию Gemini Omni для создания и редактирования видео на основе текста, а также функцию, позволяющую пользователям создавать персональные цифровые аватары. Эти инструменты призваны упростить создание видео, позволяя генерировать клипы по текстовым запросам и изображениям-референсам, а также появляться в видео без физической съемки.

media AI News (smol.ai) · 4 д назад · 2 просмотра

Qwen, NVIDIA, Mistral и Black Forest Labs выпускают новые модели; внимание уделяется маршрутизации и безопасности

Эта сводка новостей об ИИ за 3–4 августа 2026 года охватывает значительные выпуски моделей от Alibaba Qwen, NVIDIA, Mistral AI и Black Forest Labs, а также разработки в области маршрутизации агентов, инфраструктуры и кибербезопасности.

media MarkTechPost · 8 д назад · 15 просмотров

MiniMax выпустила модель MiniMax H3 для создания видео в омни-модальном формате с нативным стереозвуком и разрешением 2K

Компания MiniMax выпустила модель MiniMax H3 — универсальную мультимодальную модель генерации, которая объединяет текст, изображения, видео и аудио в едином контексте для создания видеоклипов длительностью до 15 секунд с нативным стереозвуком. В отличие от предыдущих стеков, использующих отдельные специализированные модели для конкретных задач, H3 позволяет пользователям задавать отношения между ссылками и редактированием с помощью текстовых запросов.

media r/LocalLLaMA · 9 д назад · 6 просмотров

MiniMax выпускает видео-модель MiniMax H3 с открытыми весами в ближайшее время

Компания MiniMax выпустила модель генерации MiniMax H3, универсальную мультимодальную модель, которая понимает единый контекст для текста, изображений, видео и аудио. Модель генерирует видео с нативным стереозвуком длительностью до 15 секунд и разрешением 2K.

lab Hugging Face Blog · 13 д назад · 19 просмотров

NVIDIA представляет Cosmos-H-Dreams — симулятор хирургической робототехники в реальном времени

NVIDIA представила Cosmos-H-Dreams, генеративный симулятор для хирургической робототехники, работающий в реальном времени и управляемый действиями, который переносит возможности своего Cosmos-H-Surgical-Simulator в причинную модель-студент. Система обслуживается через библиотеку ускоренного потокового вывода FlashDreams от NVIDIA и обеспечивает интерактивное управление человеком или обученной политикой по замкнутому контуру.

media MarkTechPost · 13 д назад · 1 просмотр

Black Forest Labs выпустила FLUX 3: мультимодельную модель потока для предсказания изображений, видео, аудио и действий роботов

Black Forest Labs выпустила FLUX 3 — мультимодельную базовую модель, обучающуюся на изображениях, видео и аудио в рамках единой архитектуры. Это первая модель FLUX, которая обеспечивает генерацию видео, аудио и предсказание действий с использованием одного набора весов.

media Latent Space · 16 д назад · 4 просмотра

Black Forest Labs выпускает мультимодальные flow-модели FLUX 3 и модель робототехники FLUX-mimic

Black Forest Labs запустила FLUX 3, семейство мультимодальных flow-моделей, включающее возможности генерации видео с нативным аудио. В релизе также представлена FLUX-mimic, вариант, разработанный для приложений робототехники «видео-действие».

lab Hugging Face Blog · 22 д назад · 5 просмотров

NVIDIA NeMo Automodel обеспечивает распределённую тонкую настройку диффузионных моделей с помощью Hugging Face Diffusers

Компании NVIDIA и Hugging Face интегрировали NVIDIA NeMo Automodel с библиотекой 🤗 Diffusers для обеспечения готового к производству распределённого обучения открытых диффузионных моделей. Это сотрудничество позволяет пользователям выполнять тонкую настройку любой модели в формате Diffusers на платформе Hugging Face Hub без необходимости преобразования чекпоинтов или переписывания кода модели.

media r/LocalLLaMA · 23 д назад · 1 просмотр

Видео с релизом Kimi K3 демонстрирует улучшенные творческие задачи

Вирусное видео, созданное с использованием Kimi K3 в качестве провайдера модели, было опубликовано, демонстрируя её возможности в творческих задачах. Автор отмечает, что качество вывода значительно лучше по сравнению с предыдущими примерами с GLM 5.2.

media r/LocalLLaMA · 26 д назад · 1 просмотр

Wan-Dancer генерирует связные видео танцев под музыку длительностью до нескольких минут

Исследователи представили Wan-Dancer, иерархическую систему, которая генерирует длинные высококачественные видеоролики с танцами, синхронизированные с музыкой. Система преодолевает типичное ограничение в 20 секунд у моделей диффузии за счет разделения процесса на глобальное планирование ключевых кадров и локальное временное уточнение.

arxiv arXiv cs.AI · 24 д назад · 2 просмотра

Генерация танца по музыке через атомарные движения

Исследователи представляют структуру-осознанный фреймворк для музыки-управляемой генерации танца, который моделирует хореографию как последовательность атомарных движений, а не непрерывных сигналов.

lab NVIDIA Technical Blog · 24 д назад

NVIDIA обсуждает интеграцию контекстно-зависимых видео-AI агентов в корпоративные рабочие процессы

Видеоаналитический AI-агент, способный воспринимать, рассуждать и действовать на основе огромных объемов видеоматериалов, должен быть интегрирован с существующими рабочими процессами, чтобы быть полезным. Эти рабочие процессы включают системы управления контентом, платформы обмена сообщениями, базы данных, очереди заявок и пути эскалации.

arxiv arXiv cs.CL · 24 д назад

Text2Sign: одногигабайтная диффузионная базовая модель для генерации видео жестового языка по тексту

Исследователи представляют Text2Sign, диффузионную модель с текстовой условной обработкой, предназначенную для генерации коротких клипов жестового языка на одном GPU NVIDIA L4, что позволяет снизить высокие затраты, связанные с обучением и оценкой видео-диффузионных моделей. Система объединяет замороженный текст-энкодер зрения и языка с 3D энкодером-декодером и факторизованным пространственно-временным вниманием для снижения вычислительных требований при сохранении когерентности движения.

lab NVIDIA Technical Blog · 24 д назад

NVIDIA DeepStream 9.1 обеспечивает многокамерное 3D-отслеживание

Разработчикам, создающим приложения для видеодиагностики в больших пространствах, необходимо отслеживать один и тот же объект при его перемещении между камерами. Однокамерное 2D-отслеживание не имеет надежной информации о глубине и обычно теряет объект при выходе из кадра, что ограничивает применение в таких областях, как безопасность складов, ритейл-аналитика и мониторинг умных зданий.

arxiv arXiv cs.LG · 25 д назад

Разрыв серийности в видео-диффузионных моделях

Исследователи выявили «разрыв серийности» в видео-диффузионных моделях, где производительность снижается по мере удлинения причинно-следственных цепей во время симуляций динамики твердых сфер с несколькими шарами. Контролируемые эксперименты показывают, что это снижение вызвано структурами зависимых событий, а не длиной видео, поскольку оно исчезает в контрольных группах с одним шаром без взаимодействий.

lab NVIDIA Technical Blog · 25 д назад

Постобучение NVIDIA Cosmos 3 с навыками агентов достигает точности более 90%

NVIDIA демонстрирует, что использование автономных AI-агентов для написания кода при постобучении модели зрительного рассуждения Cosmos 3 может повысить точность выше 90% при минимальных ручных усилиях.

media r/LocalLLaMA · 29 д назад

Разработчик выпустил бесплатную игру «Simulation Simulator» с локальным LLM-персонажем

Разработчик MorphLand выпустил бесплатную игру в Steam под названием "Simulation Simulator", которая интегрирует локальную большую языковую модель для роли NPC внутри игры. Игра представляет собой свободный формат общения, где игроки пытаются убедить своего ИИ-компаньона в том, что реальность является симуляцией.