Тема · Video generation
lab Google DeepMind Blog · 27 д назад · 63 просмотра

Google выпустила Gemini Omni 1.1 Flash с расширением сцен и управлением видео

Google представила Gemini Omni 1.1 Flash — новый набор творческих инструментов и возможностей генерации видео, предназначенный для подготовки модели к промышленному использованию профессионалами через Gemini API в Google AI Studio.

lab OpenAI News · 2 д назад · 17 просмотров

Higgsfield AI использует GPT-6 Astra для выпуска новых видеофункций за один день

Higgsfield AI интегрировала модель OpenAI GPT-6 Astra для ускорения внутреннего процесса разработки и улучшения платформы создания видеорекламы. Компания сообщает, что модель позволяет одному инженеру внедрить новые исследовательские функции всего за один день.

lab NVIDIA Research · 8 д назад · 15 просмотров

FastGen-PDD представляет параллельную дистилляцию декодирования для быстрого генерирования видео и изображений

Исследователи представляют Параллельную Дистилляцию Декодирования (PDD), упрощённый метод на основе траекторий для ускорения вывода в моделях диффузии и согласования потоков. В отличие от современных подходов, полагающихся на сложную оптимизацию вариационной дистилляции оценок и состязательных потерь, PDD предсказывает несколько шагов денормализации за одну оценку сети.

media TLDR AI · 19 д назад ARC-AGI 3 · 62.7% · 54 просмотра

Nvidia приобретает Hugging Face; OpenAI выпускает GPT-6 Astra; Microsoft запускает MAI-Transcribe-2

В начале сентября 2026 года Nvidia подтвердила приобретение Hugging Face за $12,93 млрд, в то время как OpenAI выпустила GPT-6 Astra, а Microsoft представила модель распознавания речи MAI-Transcribe-2.

media MarkTechPost · 25 д назад · 51 просмотр

Google выпустила Gemini Omni 1.1 Flash с расширением сцены до 40 секунд и черновиками в 360p

Google выпустила Gemini Omni 1.1 Flash, производственное обновление своей нативной мультимодальной модели генерации видео, которое смещает фокус с простой генерации на управляемое редактирование. Обновление вводит состоятельные взаимодействия через Interactions API, позволяя пользователям изменять видео, сохраняя предыдущий контекст без повторной загрузки файлов.

arxiv arXiv cs.AI · 5 ч назад · 10 просмотров

VideoX-Qwen представляет центрированную на данных структуру для редактирования видео по инструкциям

Исследователи представляют VideoX-Qwen, интегрированную структуру, сочетающую масштабируемое конструирование данных с обучением модели для продвижения общего назначения, управляемого инструкциями, редактирования видео. Система использует производственный конвейер, который организует специализированные модели для генерации записей направленного редактирования, что приводит к более чем 1,2 миллиона высококачественных образцов по задачам добавления, удаления, замены и атрибутов.

media Hugging Face Forums · 10 д назад · 20 просмотров

NanoAvatar позволяет запускать локальные говорящие аватары на Android через Qualcomm QNN

NanoAvatar — это проект с открытым исходным кодом, который запускает реалистичные говорящие аватары локально на старых телефонах Android без необходимости использования облачного GPU. В релиз включены открытый код, веса модели и APK-файлы для Android, которые содержат модель и аватар для автономного использования с голосом пользователя.

arxiv arXiv cs.LG · 12 д назад · 29 просмотров

Vidu S2 представляет модели интерактивных аватаров и редактирования в реальном времени

Vidu S2 включает Vidu S2-Avatar, модель интерактивного цифрового персонажа в реальном времени, и Vidu S2-Editing, модель видеоредактирования в реальном времени. Система также исследует возможность генерации пространственного видео в реальном времени для обоих компонентов.

media Hugging Face Forums · 18 д назад · 25 просмотров

Тестирование согласованности персонажа Seedance 2.5 в нескольких модных образах

Пользователь протестировал модель генерации видео Seedance 2.5 с использованием короткой модной и редакционной последовательности, включающей одного персонажа в различных нарядах, композициях и визуальных стилях.

media Hugging Face Forums · 23 д назад · 32 просмотра

Тестирование Seedance 2.5 на согласованность видео в модном стиле

Пользователь протестировал модель Seedance 2.5, используя короткие концепции видео в модном и редакционном стилях, чтобы оценить её способность сохранять визуальную согласованность между кадрами.

media TLDR AI · 26 д назад · 38 просмотров

Gemini Omni 1.1 Flash добавляет управление видео; Codex поддерживает постоянные рассуждения

Google представила Gemini Omni 1.1 Flash с новыми элементами управления для расширения сцен, интерполяции первого и последнего кадров, масштабирования до 4K и более быстрой итерации видео через Gemini API.

media Hugging Face Forums · 26 д назад · 39 просмотров

Тестирование Seedance 2 выявило сильные стороны в движении камеры и атмосфере

Оценка модели генерации видео на основе ИИ Seedance 2 подчеркивает её улучшенное понимание кинематографических элементов по сравнению с более ранними версиями. Тест показывает, что, хотя модель хорошо справляется с визуальной непрерывностью и освещением, ей всё ещё трудно обеспечить согласованность сложных объектов и справляться с перегрузкой промптов.

media Latent Space · 26 д назад · 56 просмотров

OpenAI ставит цель достичь AGI к концу 2026 года; запущен робот Microduck

Главный научный сотрудник OpenAI Якуб Пачоцкий заявил, что нерелизная модель Astra должна стать «Автоматизированным стажером по исследованию ИИ» к сентябрю 2026 года, в то время как генеральный директор Сэм Альтман оценивает, что компания объявит о достижении AGI внутри компании к декабрю 2026 года.