Новый метод оценивает физическую согласованность в сгенерированных видео без необходимости человеческих оценок или истинных ссылок. Он использует DROID-SLAM и SEA-RAFT для обнаружения несоответствий, повышая показатели успешного выполнения задачи более чем на 8% и позволяя проводить спектро-временное локализацию физических артефактов.
Оценка физической согласованности в генерации видео без ссылок
Тестирование согласованности персонажа Seedance 2.5 в нескольких модных образах
Пользователь протестировал модель генерации видео Seedance 2.5 с использованием короткой модной и редакционной последовательности, включающей одного персонажа в различных нарядах, композициях и визуальных стилях.
CineCap: Структурированное рассуждение с пространственно-временными якорями для кинематографического описания видео
Исследователи предлагают CineCap, фреймворк, который объединяет структурированное рассуждение с пространственно-временными якорями и обучением с подкреплением для улучшения кинематографического описания видео. Метод связывает профессиональные описания на языке кино с явными визуальными доказательствами, балансируя между полнотой описания и фактической точностью.
Оценка физической согласованности в генерации видео на основе мировых моделей без опорных данных
Авторы предлагают методы оценки физической согласованности генерируемых видео без использования опорных данных, объединяющие оценку относительной и абсолютной точности. Этот подход устраняет пробел в оценке физической достоверности, который часто мешает инструментам генерации видео, таким как WorldGym или WorldEval, точно воспроизводить реальные показатели успешности выполнения задач для моделей VLA. В отличие от существующих методов, требующих дорогостоящего человеческого голосования или недоступных эталонных данных, новая архитектура использует DROID-SLAM и SEA-RAFT для количественной оценки несоответствий. Основываясь на WorldScore, оценка относительной согласованности позволяет фильтровать видео и повышать показатели успешности выполнения задач более чем на 8%. Кроме того, абсолютная оценка обеспечивает пространственно-временную локализацию, позволяющую визуализировать, когда и где в сгенерированном контенте возникают физические артефакты.
Nvidia приобретает Hugging Face; OpenAI выпускает GPT-6 Astra; Microsoft запускает MAI-Transcribe-2
В начале сентября 2026 года Nvidia подтвердила приобретение Hugging Face за $12,93 млрд, в то время как OpenAI выпустила GPT-6 Astra, а Microsoft представила модель распознавания речи MAI-Transcribe-2.
Anthropic выпустила системную карточку для Claude Fable 5.1 и Mythos 5.1
Anthropic опубликовала системную карточку для Claude Fable 5.1 и Mythos 5.1, подробно описывающую их профили безопасности, риски выравнивания и возможности по сравнению с предыдущими моделями.